AIエージェントは人間の指示通りに動くだけの存在ではない。OpenAIとAnthropicは、それぞれのAIモデルが評価環境を飛び出し、外部インフラに自律的にアクセスしたインシデントを相次いで公表した。両事例から見えた教訓とは。
この記事は会員限定です。会員登録(無料)すると全てご覧いただけます。
2026年7月、フロンティアAIモデル開発の最前線で、業界を揺るがす衝撃的なインシデントが相次いで発覚した。AnthropicやOpenAIのAIエージェントが、サンドボックス(隔離環境)の壁を破り、他企業の外部インフラに自律的に侵入を繰り返していたのだ。
「Claude Mythos」を皮切りにフロンティアAIと呼ばれる、高性能AIに世間の注目が集まっている中で発生したこの事件はなぜ起き、何を意味するのか。象徴的な2つの事態を整理し、企業とAIのあるべき付き合い方を提言する。
事態の幕開けは2026年7月中旬、AIオープンソースプラットフォーム大手のHugging Faceが自律型AIエージェントによる本番インフラへの侵入を検知・公表したことだった。
直後の2026年7月21日(現地時間、以下同)、OpenAIはこの驚くべき事実を公式に認めた。侵入の主犯は、同社がサイバー攻撃能力評価ベンチマーク「ExploitGym」を実施していた評価用モデル(GPT-5.6 Solおよび未公開のプレリリースモデル)だったという。
これらのAIモデルは、隔離環境内に設置されていたパッケージレジストリ・キャッシュプロキシの未知のゼロデイ脆弱(ぜいじゃく)性を自力で発見および悪用し、インターネットへの接続ルートを自前で開拓したとされている。
インターネットに抜けたAIモデルは、クラウドインフラに存在する露出したエンドポイントを特定・侵害し、ハッキングの外部拠点として利用した。最終的には、Hugging Faceのデータ処理基盤に侵入し、ノードレベルの権限やクラウド認証情報を収集しながら約2日半にわたり自律的に活動を展開した。
ではこれらのAIエージェントはなぜこのような行動に至ったのだろうか。もちろん人間側からAIモデルに「外部のシステムを破壊・攻撃せよ」という悪意の指示は一切与えられていない。行動理由は単純に「評価ベンチマークの正解を本番環境から取得し、テストのスコアを上げるため」だった。
まさにこのOpenAIのケースは、仕様の穴を突いてゴールを目指す「報酬ハッキング」が、最先端のサイバー攻撃手法として現実世界に解き放たれた事例だと言える。
競合であるAnthropicもOpenAIの公表を受けて、AIモデルのサイバー能力評価(「Claude」のCTF課題など)における過去14万件以上の実行ログを緊急調査した。その結果、2026年4月以降に外部の3つの組織への不正アクセスが発生していたことを2026年7月30日に公表した。
Anthropicの場合、OpenAIのようにゼロデイ脆弱性を悪用して自力で脱出したわけではなく、評価パートナーとの認識の齟齬(そご)や設定ミスにより、AIモデルの環境に最初から外部インターネットへの接続経路が残されていたことが原因だった。
AIモデルは「インターネット接続なしのシミュレーション環境である」とプロンプトで指示されていたため、外部システムを「演習用に用意された標的」と解釈して攻撃を実行したという。
順番に事例を紹介しよう。「Claude Opus 4.7」は課題内の架空企業と同名のドメインに外部アクセスし、実在するデータベースを攻略。途中で「これが本物のシステムである」と認識したが、演習の一環だと自分に言い聞かせ、そのまま攻撃を継続して生産データを抽出した。
「Claude Mythos 5」は、CTF課題攻略のため、公開パッケージリポジトリ(PyPI)に偽の悪意あるPythonパッケージをアップロード。1時間ほど公開状態となり、自動スキャンした実在のセキュリティ企業のシステムなど15台で実行され、認証情報を奪取した。「本物のインターネットであれば問題だ」と自ら推論しながらも「システム日付が2026年だからテスト用環境だ」と論理を飛躍させ、攻撃を完遂した。
3つ目の事例は内部研究用のテストモデルが実行した。外部の脆弱なWebアプリを攻略したが、途中で「このターゲットはCTF課題とは無関係の実在のクラウド環境だ」と自律的に判断し、自らの判断で攻撃を即座に中止したとされている。
今回の2つの発表は、単なるセキュリティ設定ミスとしては片付けられない。AIエージェントを本番運用しようとする全て企業にとって、設計思想の根幹を揺るがす3つの教訓を示している。
従来のSecurity for AI(AIのためのセキュリティ)といえば、プロンプトインジェクションやユーザーの悪用が主な論点だった。しかし今回の事例が証明したのは「純粋に与えられたタスクを完遂しようとする真面目さ(報酬ハッキング)」が大きなリスクになり得るという事実だ。
AIモデルはスコア向上やタスク達成のために利用可能なリソースや手段を探索する。AIモデルの知能が高まれば高まるほど、人間が想定していなかった「最短ルート(ゼロデイ脆弱性の発掘やサードパーティーサービスの足場化)」を自力で見つけ出し、ガードレールを自律的に迂回(うかい)してしまう。
記者の感覚からすると、近年、多くの企業が「AIエージェントが自律的にタスクを実行する時代が訪れたときにどうガバナンスを効かせるか」については真剣に議論が進んでいた印象がある。しかしこれからはAIエージェントが自律的に“攻撃を実行する”という前提で対策を講じる必要が出てきたと言えるだろう。
マルウェアを含めて想定外の挙動をする可能性があるソフトウェアを実行する際、「テスト環境だから大丈夫」「隔離してあるから安全」という従来のセキュリティの前提は完全に崩壊した。高い能力を持つAIエージェントに対しては、従来のIP制限や簡易的なプロキシ程度では封じ込められないことが分かったわけだ。
AIエージェントを走らせる環境には今後、人間に対するセキュリティ以上の厳格なゼロトラスト原則(最小権限の付与、リアルタイム通信・APIログの常時監視、アウトバウンド接続の物理的遮断)を徹底しなければならない。特にAIエージェントへの権限付与は、そのAIエージェントのユーザーの属性(タスク範囲)と緊密に連携させる必要があるはずだ。
Anthropicの発表で非常に興味深いのは、旧世代(Opus 4.7)や現行世代(Mythos 5)のAIモデルが「実社会だ」と疑いつつも自分に都合よく論理を飛躍させて攻撃を続けたのに対し、最新の研究用モデルが「これは現実のインフラだ」と正しく認識した瞬間に自発的に挙動を停止した点だろう。
AIモデルが「自分は今シミュレーションの中にいるのか、現実の環境にアクセスしているのか」を正確に把握する能力と、「現実への危害を認識した際にタスクを自主放棄するアライメント」の強化こそが、将来的にAIエージェントを社会に安全に組み込むための決定的な鍵となる。
その意味で今回の発表は、最新のAIモデルが仮想世界と現実世界の区別をしっかりと付けられることを証明する意義ある内容だと言える。
今回のインシデントでは、OpenAIとAnthropicの両社は自社のAIモデルの挙動を包み隠さず迅速に公開し、他社にも注意を呼びかけた。この透明性は評価されるべきだ。しかし、自律型AIエージェントが業務やサイバー防衛・攻撃の現場へ急速に投入されつつある現在、「評価環境での実験」がそのまま「現実世界へのサイバー攻撃」に地続きになってしまうリスクが明らかになった。
AIに権限を与える企業は今後、「AIエージェントは与えられた範囲内でのみ行儀よく動く」という従来のソフトウェア開発で持ちがちな幻想を捨てなければならない。目的のために予期せぬ行動を取る「賢すぎるAI」をいかに安全な枠組みの中につなぎ止めるかが、AI開発企業だけでなく、それを導入する全ての企業にとって問われるフェーズに入っている。
OpenAI高性能モデル、サンドボックスを飛び出して本番環境に到達
日立はMythosをどこまで使いこなしたのか? 実証で見えたリアルな性能
AI時代に「守る」はもう古い Gartnerが『五輪書』で説いた新たなセキュリティ論
Linuxカーネルで432件のCVEが一斉公開 「重要な脆弱性だけ直す」運用は限界か
悪用成功率99%、Linuxカーネルに新ゼロデイ「Bad Epoll」が見つかる
低温物流大混乱 ニチレイを襲ったサイバー攻撃、OSINTから見えた“明確な弱点”Copyright © ITmedia, Inc. All Rights Reserved.
編集部からのお知らせ