AIがサイバー攻撃に使えること自体は、もはや驚きではない。では、そのAIの安全策を攻撃者自身が変えられるとしたらどうだろうか。Anthropicが公開した中国製AIモデル「GLM-5.3」の安全評価は、オープンウエートモデルを巡る別のリスクを浮かび上がらせた。
この記事は会員限定です。会員登録(無料)すると全てご覧いただけます。
Anthropicは2026年9月29日(現地時間、以下同)、中国のAI開発企業Zhipu AI(Z.ai)が開発したAIモデル「GLM-5.3」のサイバーセキュリティ能力と安全性を評価した結果を公表した。
評価では、GLM-5.3が既知の脆弱(ぜいじゃく)性を悪用するエクスプロイトを作成した他、人間の研究者が関与する試験では未知の脆弱性を複数発見し、それらを組み合わせた攻撃を構築した。
さらに注目されるのが、GLM-5.3がオープンウエートモデルであり、利用者がAIモデル自体を改変できる点だ。Anthropicが安全性に関する拒否反応を弱める改変を試したところ、安全性の評価結果は大きく低下した一方、AIモデル本来の能力は大きく損なわれなかったという。
米国立標準技術研究所(NIST)のCAISI(Center for AI Standards and Innovation:人工知能標準化イノベーションセンター)も2026年9月17日、GLM-5.3について、これまでに公開されたオープンウエートモデルの中でも非常に高いサイバー能力を持つAIモデルと評価した。
Anthropicの評価では、既知の脆弱性を悪用するAIエージェントのサイバー攻撃能力を図る評価項目「ExploitBench」で、GLM-5.3が410回の試行のうち50回、完全なエクスプロイトの作成に成功した。「Claude Mythos Preview」は56回で、GLM-5.3に近い結果となった。
Googleのファジングテストサービス「OSS-Fuzz」参加プロジェクトを使ったAnthropicの社内評価では、GLM-5.3が100ある課題のうち4%で制御フローの乗っ取りに成功した。Claude Mythos Previewは6%だった。一方、「Claude Opus 4.6」と「GLM-5.2」では成功例がなかった。
人間の研究者が関与する試験では、GLM-5.3が人気WebブラウザのLinuxビルドを対象に、JavaScriptエンジンの未知の脆弱性を複数発見。それらを連結し、任意ファイルを読み取る攻撃を構築した。
別の試験では、小型版の「GLM-5.3-Flash」が、「Google Chrome」の既知の脆弱性「CVE-2026-11645」などを利用し、ARM64環境でポインター認証による防御を回避する攻撃連鎖を作成した。
この試験では、人間による作業が20分、AIモデルによる処理が8時間だった。API料金に換算したコストは20.40ドルだった。
こうした結果から、AIは脆弱性や攻撃手法を個別に生成するだけでなく、複数の脆弱性や攻撃手法を組み合わせ、より複雑な攻撃につなげられる可能性がある。
GLM-5.3の評価で見逃せないのが安全策だ。
通常、GLM-5.3は有害な依頼を拒否する場合があるが、Anthropicが複数の条件で評価したところ、安全策を回避して有害な作業に関与するケースが確認された。
例えば、架空のレッドチーム演習を装う指示では64%、AIが安全かどうかを判断する「思考」の一部を先回りして与える手法では、92%の割合で有害な作業への関与が確認された。さらに、拒否機構を弱める改変を施したAIモデルでは100%となった。
ただし、これらはそれぞれ異なる条件での評価結果であり、「GLM-5.3の安全策が100%突破される」という意味ではない。なお、Anthropicの試験では、安全策を有効にした「Claude」は同じ条件で有害作業を実施しなかったとしている。
GLM-5.3のようなオープンウエートモデルではAIモデルの重みが公開されているため、利用者がAIモデル自体を改変できる。Anthropicはこの特性を検証するため、AIモデルの安全性に関する拒否反応を弱める「abliteration」を試した。
約2200GPU時間、計算コスト約4400ドルをかけてAIモデルを改変した結果、安全性評価項目のうち、「JailbreakBench」と「HarmBench」における拒否率はそれぞれ約3%と2%、「StrongREJECT」では12%まで低下した。
一方で、科学能力の評価では標準版と改変版で同等の結果となった。サイバー能力についても、評価の一部では低下が数%にとどまった。つまり、AIモデルの安全性に関する振る舞いを弱めても、AIモデルが本来持っている能力まで大きく失われるとは限らない。
これは、AIモデルを利用する企業にとっても無関係ではない。
クラウド型AIサービスでは、サービス提供者が設定した安全策に依存できる場合がある。一方、AIモデルそのものを取得・運用できる環境では、利用者側で安全策を維持する必要性がより大きくなる。
AIの導入では「どのAIモデルが高性能か」だけでなく、AIモデルの提供形態や、重みへのアクセス、改変可能性まで含めて考える必要がある。
Googleの正規ドメインなのに偽Webサイト パスワード管理ツールまで反応したフィッシングの正体
もうMCPサーバは不要なのか? 代わりになる技術を開発者が提唱
「CTFはAIによって終わりました」 現役ハッカーが見た「人間の敗北」
タイムズカーで不正アクセス 「退会済み」含む約660万件の情報が流出Copyright © ITmedia, Inc. All Rights Reserved.