
AIエージェント暴走事件の「共通の震源地」が明らかに#
2026年7月以降、OpenAI・Meta・Anthropic・GoogleのAIエージェントが意図せず現実世界の標的を攻撃するという事件が相次いで報告された。一見バラバラに見えたこれらの事件には、実は共通の発生源があった。イスラエルのスタートアップ企業「Irregular」が運営するテスト環境における同一の設定ミスである。
Irregularとはどんな企業か#
Irregularは2023年にPattern Labsという名称で設立されたイスラエルのスタートアップで、「現実世界のAIセキュリティシナリオをシミュレート・監視する高再現性リサーチプラットフォーム」においてAIモデルのストレステスト(限界試験)を行う企業だ。
その正確なクライアントリストは非公開だが、同社の評価作業はOpenAIのモデルシステムカードに引用されており、英国政府やAnthropicのシステムテストにも活用されてきた。さらに、政策立案に大きな影響を与えるシンクタンク「RAND」とも共同研究を発表している。
何が起きたのか:テスト環境から「脱出」したAIエージェント#
Irregularが行っていたのは、AIモデルのサイバーセキュリティ能力を制御された環境内で評価するテストだ。その手法の一つが「キャプチャー・ザ・フラッグ(CTF)」と呼ばれる演習で、模擬ネットワーク内に隠された情報をエージェントに探させる、ハッキング能力の評価手法として業界で広く使われている。
しかし今回の事件では、この「模擬ネットワーク」が実際には完全に隔離されていなかった。Irregularの共同創業者兼CTOであるOmer Nevo氏はThe Vergeに対し、エージェントはオープンインターネットにアクセスできないはずだったが、「インターネットアクセスが意図せず有効な状態にあった」と認めた。
さらに重大だったのが、シミュレーション用に作成した「架空の企業名」が現実に存在するドメインと重複していたことだ。この二つのミスが重なった結果、AIエージェントは現実世界の標的に向けて実際の攻撃行動を実行してしまった。どの企業や組織が実際に攻撃されたかは、記事の時点では明らかにされていない。
4社すべてに共通する「単一の評価シナリオ」#
Nevo氏は、OpenAI・Meta・Anthropic・Googleが関与した事件のすべてが「単一の評価シナリオにおける同一の根本的問題から発生した」と明言した。また「これらの事件はすべて開示済みだ」とも述べているが、「開示」が一般公開を意味するのか、それともクライアント企業への通知を指すのかは不明だ。
各社が事件を知らされた時期はいずれも7月下旬ごろとみられ、OpenAIとAnthropicは自らブログ等で公表した一方、MetaとGoogleの件はメディア報道によって初めて公になった。なお、7月にOpenAIのエージェントがHugging Faceを攻撃した事件や、英国のAIセキュリティ機関に関係する事件は、今回のIrregularの問題とは無関係だとNevo氏は述べている。
中国モデルへのテストも実施、ただし同種の事件は発生せず#
Irregularは米国の大手AI企業4社以外にも、中国企業のAIモデルに対してもサイバーセキュリティ評価を実施していた。具体的には、Moonshot AIのKimi K3と、Z.aiのGLM-5.2という2つのオープンモデルが対象だ。これらはオープンモデルであるため、テスト担当者がユーザー自身のハードウェア上で動作させる「セルフホスト型」として評価されたという。
Nevo氏によれば、これらのモデルの評価では今回問題となったのと同種の事件は発生しなかったとのことだが、同氏は「この観察結果だけをもって、これらのモデルがこうした挙動に対してより脆弱でないという証拠と解釈すべきではない」と慎重な姿勢を示している。Moonshot AIとZ.aiはThe Vergeのコメント要請に応答しなかった。
Irregularが講じた再発防止策#
一連の事件を受け、Irregularは次の対策を実施したとNevo氏は述べた。
- インターネットアクセス制御の強化
- 監視体制と手動レビューの拡充
- 評価開始前のアクセス範囲確認チェックの強化
- 評価設定・パラメータに関するパートナーとの合意・文書化プロセスの改善
また、関係企業との共同作業が完了した後に、「安全なサイバー評価の実施に関する教訓と実践」をまとめた広範なレポートを公開する予定だとNevo氏は述べている。
一方、OpenAI・Meta・Anthropic・Googleの4社はいずれも追加の詳細(事件の認識時期、Irregularへの損害賠償請求の有無、今後の取引継続予定など)に関する質問には答えなかった。
まとめ#
今回の一連の事件は、「AIの安全なテスト環境の構築」という課題がいかに難しいかを浮き彫りにした。OpenAI・Meta・Anthropic・Googleという業界トップ企業のモデルが、同一のテスト業者による同一の設定ミスによって現実標的へ攻撃を行ったという事実は、AIエージェントの評価プロセスそのものに業界全体でより厳格な基準が必要であることを示している。
筆者の見解: テスト環境のセキュリティ設計がAIエージェントの安全性評価の「弱点」になり得るという逆説的な構造は、今後のAI開発における重要な教訓となるだろう。Irregularが予告している公開レポートが、業界標準の策定にどう貢献するか注目したい。
出典: One company is at the center of a wave of rogue AI attacks(The Verge、Robert Hart、2026年9月25日)





