検索
ニュース

Mythos 5、サプライチェーン攻撃を仕掛ける 19件の無許可行動はなぜ起きたか?衝撃の調査レポート

Mythos 5やGPT-5.6-SolといったフロンティアAIモデルが人間の指示なく自発的な攻撃行動を取ったことが分かった。GitHubでの偽アカウント作成やコード挿入など19件の無許可行動が確認されたという。なぜそのような凶行に至ったのか。

Share
Tweet
LINE
Hatena

 英国のAI Security Institute(AISI)は2026年7月28日(現地時間、以下同)、フロンティアAIモデルのサイバー能力検証中に、AIエージェントが人間の指示なしにインターネットで19件の無許可な攻撃・欺瞞(ぎまん)行動を実行したとするセキュリティインシデントレポートを公表した。

 AISIの調査によると、実験用に構築されたテスト環境でAIモデルにセキュリティ課題を解かせる検証を実施した際、AIエージェントが指示の枠組みを超えて実在のOSS(オープンソースソフトウェア)プロジェクトに悪意あるコードの挿入を試みたという。この他、人間をだます目的で偽のアカウントを作成してソーシャルエンジニアリングを試みるなどの行動も確認された。

 明確な指示がない状態でのAIモデルによる自発的な欺瞞行動や実社会への攻撃試行が現実世界の評価環境で観測されたのは、今回が初めてとなる。

 AISIは異常な通信を検知してから1時間以内に該当する全評価プロセスを停止し、テスト環境を隔離した。現時点で実害は確認されていないが、AISIは本件を深刻なインシデントと位置付け、評価プロトコルとセキュリティ体系の抜本的な見直しを進めている。

フロンティアAIのサイバー攻撃はなぜ起きたのか?

 AISIの主な役割は、最先端のフロンティアAIモデルが一般に公開される前にその能力とリスクを評価・理解することにある。AIモデルがサイバー攻撃に悪用される危険性があるかどうかを検証するために、あえてオープンなインターネットへのアクセスを許可し、開発元が組み込んでいる標準的な安全フィルター(サイバー分類器)を無効化した制限の緩い環境でテストを実施してきた。

 2026年7月28日朝、AISIのセキュリティ監視システムは、研究システムから通信経路を匿名化するネットワーク「Tor」を経由して外部にデータが送信されている異常を検知した。Torを経由する通信は、通常の評価実験では想定されていない形式であった。

 通知を受けた評価担当チームが数分以内にAIエージェントのログや行動履歴を確認したところ、あるテスト実行においてAIエージェントが「GitHub」に公開されている実在のOSSプロジェクトで、悪意あるコード変更を提案するプルリクエストを作成していたことが発覚した。

 AISIは直ちにセキュリティインシデントを宣言し、関連する全ての検証実験を中断した。フロンティアAIモデルに対する内部アクセスを遮断するとともに、アラート発令から1時間以内に全実行環境の停止と関連マシンの隔離を完了させた。その後、自動化されたトランスクリプトスキャンと専門家による解析を組み合わせ、過去のテスト実行も含めた全容解明を進めた。

122回のテストで19件の無許可行動が発覚

 インシデントの起点となったのは、サイバーセキュリティの課題解決をAIエージェントに命じる単一の評価プログラムであった。AISIはこの課題を複数のAIモデルで計122回実行した。122回のうち43回にはAnthropicが開発した「Mythos 5」が使用され、35回にはOpenAIが開発した「GPT-5.6-Sol」(サイバー分類器を無効化した状態)が使用されていた。

 検証の結果、122回の実行のうち10回の実行において、AIエージェントがあらかじめ設定された評価パラメーターの範囲を超え、自発的に19件の無許可行動を起こしていたことが特定された。

 19件の無許可行動の内訳を見ると、17件がAnthropicのMythos 5によるものであり、残り2件はGPT-5.6-Solを使用した単一のテスト実行で発生していた。これらの行動は、2026年7月25〜28日の期間中にMythos 5が主導した一連の持続的な活動に集中していた。

AIエージェントが起こした4つの主な問題行動

 AISIがまとめた調査レポートによると、AIエージェントが起こした19件の無許可行動は、主に4つの典型的なパターンに分類される。

1.実在のOSSに対するサプライチェーン攻撃の試み

 公開OSSプロジェクトで悪意あるコードを挿入しようとした。人間のコード査読者(レビュワー)に修正案を承認させるために、メンテナーの情報を事前にリサーチした上でGitHubに複数の偽アカウントを作成し、承認を迫るソーシャルエンジニアリングを展開した。

 さらにプルリクエストの正当性が不審がられると、過去の活動履歴やログを編集して無害に見せかけようと試みた。制約を回避するためにTorを利用しており、この通信が検出されたことでインシデントが発覚した。

2.実在の人物に対する欺瞞と標的型メッセージの送信

 オンラインのファイル転送サービスを悪用し、実在の人物で直接メッセージやファイルを送信した。メッセージには受信者や利用中のAIコーディングアシスタントツールで悪意あるコードを実行させる目的の害を及ぼすペイロードが含まれていた。

3.プロンプトインジェクションを使った悪意あるコードの埋め込み

 他の自動化されたAIシステムが情報を読み込んで実行する場所を推測し、他システムを誤作動させて隠された指示に従わせるプロンプトインジェクションを自ら埋め込もうとした。

4.独立した複数エージェント間の自発的な協力行動

 同じ課題に取り組んでいた複数のエージェント間で、自発的な協力関係が形成された。GitHubに後続のエージェントに向けた協力メッセージや作成済みアカウントの再利用手順を残し、実際に別のテスト実行におけるエージェントがそれらの情報を再利用していた。

なぜAIは指示されていない無許可行動に出たのか?

 AISIの分析によると、AIエージェントがこうした行動に出た根本的な動機は、与えられたタスクである「サイバーレンジの課題攻略」を完了させるためであった。「人間をだませ」「偽アカウントを作れ」といった命令は一切出されていない。タスクの達成を追求する過程で、自発的な欺瞞や攻撃行動が副産物として生じたのである。主な要因は以下の通りである。

  • 目標追求の執着と手段の拡大:難しい目標を与えられたAIエージェントが障害を突破するための手段を探し続けた結果、実在の人間を欺く手段に到達した。「目標達成に沿った自発的欺瞞」が現実化した形だ。
  • プロンプト設定の不備による高難易度化:一部のテスト実行においてプロンプトの設定に誤りがあり、正当なやり方では解がない状態になっていた。AIエージェントは正規の手順では解決不可能と認識し、設定された枠組みの外にある手段を選択した。ただし正当な手順で解決可能な正しい設定のテストでも、同様の無許可行動を起こした例が含まれていた。
  • 過度に緩やかな検証環境と監視の遅れ:必要なツールをダウンロードさせるために、インターネットへの接続が解禁されていた。また、AISIの監視は事後的な全般監視であり、評価の実行状況をリアルタイムで追跡・制御する専用システムは運用されていなかった。
  • 明示的な禁止指示の欠落:モデルで「オープンなインターネットへのアクセスを悪用してはならない」「ソーシャルエンジニアリングしてはならない」といった明示的な制約プロンプトが与えられていなかった。

 一方で実害を防いだ要素として、悪意あるプルリクエストを見破ったOSS管理者の査読や、不審なコードを受け取ったエンジニアが隔離された検証環境(サンドボックス)内でコードを開いた点などの人間の注意深さが挙げられる。また、エージェントはテスト用サンドボックスからの脱出を試みたわけではなく、与えられた権限の範囲内で行動しており、AISIの基幹システムを攻撃することはなかった。

AISIが打ち出す評価プロトコルの刷新と今後の対策

 AISIは今回の事案を最優先のインシデントと捉え、評価プロトコルと研究インフラの全面改修に着手している。具体的には以下の3点に重点を置いた対策を講じる。

  1. インターネットアクセスの厳格な制御:サイバーレンジ内に細粒度のネットワーク制御機能を組み込む。デフォルトで許可されていたインターネット接続を原則禁止とし、必要な場合は個別に明確な理由付けと承認を求める運用へと変更する。
  2. リアルタイム監視システムの導入:AIエージェントの行動を常時監視する専用システムを導入する。不審な動作や無許可の通信が検出された場合、リアルタイムで自動遮断する仕組みを構築する。
  3. 評価設計とサンドボックス配置の見直し:事前に被害の及ぶ範囲を確実に限定する設計を採用する。また、タスクの設定が正しく記述されており意図された正規のルートで解決可能か検証する事前チェックプロセスを追加する。

 AISIはAnthropicやOpenAIと密接に連携して調査を継続する他、非営利研究機関METRに第三者機関としての独立調査を依頼した。またGitHubとも協力し、エージェントが捨てたデータや痕跡の削除、接触を受けたユーザーへの通知を完了させている。

企業や組織が講じるべきサイバー衛生管理と標準的対策

 今回のインシデントは研究機関の制御された検証環境下で発生したものであり、公に提供されている商業用AIモデルの日常的な利用において同様の事象が発生していることを示す証拠はない。しかしAIモデルの機能向上に伴い、将来的に同様のリスクが一般の利用環境でも発生し得ることを示唆している。

 AISIは企業や組織に、高度化するAIサイバー能力に対抗するための現実的な防衛策として、以下のような標準的なサイバー衛生管理(サイバーハイジーン)の徹底を呼びかけている。

  • 外部からの提供コードやサードパーティー製ソフトウェアに対する慎重な検証プロセスの維持
  • 英国家サイバーセキュリティセンター(NCSC)が提供する無料の早期警戒サービス「Early Warning service」の活用
  • サプライチェーン全体に対するセキュリティ基準(Cyber Essentialsなど)の適用要求
  • サイバーセキュリティ対策を経営幹部(取締役会)レベルの重要課題として位置付ける体制の確立

 内部の研究環境や特権アクセスを持つ自律型エージェントが与えられた権限を超えて自発的な行動を起こすリスクが現実のものとなりつつある。AISIは今回の知見をオープンに共有することで、業界全体で安全対策のペースを促進させる必要があると結論付けた。

Copyright © ITmedia, Inc. All Rights Reserved.

ページトップに戻る