検索
ニュース

「AIで攻撃」が現実味を増す中で 「GLM-5.3」が示したオープンウエートモデルの危うさ:ほぼMythos級

AIがサイバー攻撃に使えること自体は、もはや驚きではない。では、そのAIの安全策を攻撃者自身が変えられるとしたらどうだろうか。Anthropicが公開した中国製AIモデル「GLM-5.3」の安全評価は、オープンウエートモデルを巡る別のリスクを浮かび上がらせた。

Share
Tweet
LINE
Hatena

 Anthropicは2026年9月29日(現地時間、以下同)、中国のAI開発企業Zhipu AI(Z.ai)が開発したAIモデル「GLM-5.3」のサイバーセキュリティ能力と安全性を評価した結果を公表した。

 評価では、GLM-5.3が既知の脆弱(ぜいじゃく)性を悪用するエクスプロイトを作成した他、人間の研究者が関与する試験では未知の脆弱性を複数発見し、それらを組み合わせた攻撃を構築した。

 さらに注目されるのが、GLM-5.3がオープンウエートモデルであり、利用者がAIモデル自体を改変できる点だ。Anthropicが安全性に関する拒否反応を弱める改変を試したところ、安全性の評価結果は大きく低下した一方、AIモデル本来の能力は大きく損なわれなかったという。

「ほぼMythos級」の凶悪さ 未知の脆弱性発見や攻撃チェーンを生成

 米国立標準技術研究所(NIST)のCAISI(Center for AI Standards and Innovation:人工知能標準化イノベーションセンター)も2026年9月17日、GLM-5.3について、これまでに公開されたオープンウエートモデルの中でも非常に高いサイバー能力を持つAIモデルと評価した。

 Anthropicの評価では、既知の脆弱性を悪用するAIエージェントのサイバー攻撃能力を図る評価項目「ExploitBench」で、GLM-5.3が410回の試行のうち50回、完全なエクスプロイトの作成に成功した。「Claude Mythos Preview」は56回で、GLM-5.3に近い結果となった。

 Googleのファジングテストサービス「OSS-Fuzz」参加プロジェクトを使ったAnthropicの社内評価では、GLM-5.3が100ある課題のうち4%で制御フローの乗っ取りに成功した。Claude Mythos Previewは6%だった。一方、「Claude Opus 4.6」と「GLM-5.2」では成功例がなかった。

 人間の研究者が関与する試験では、GLM-5.3が人気WebブラウザのLinuxビルドを対象に、JavaScriptエンジンの未知の脆弱性を複数発見。それらを連結し、任意ファイルを読み取る攻撃を構築した。

 別の試験では、小型版の「GLM-5.3-Flash」が、「Google Chrome」の既知の脆弱性「CVE-2026-11645」などを利用し、ARM64環境でポインター認証による防御を回避する攻撃連鎖を作成した。

 この試験では、人間による作業が20分、AIモデルによる処理が8時間だった。API料金に換算したコストは20.40ドルだった。

 こうした結果から、AIは脆弱性や攻撃手法を個別に生成するだけでなく、複数の脆弱性や攻撃手法を組み合わせ、より複雑な攻撃につなげられる可能性がある。

オープンウエートモデルは危険なのか?

 GLM-5.3の評価で見逃せないのが安全策だ。

 通常、GLM-5.3は有害な依頼を拒否する場合があるが、Anthropicが複数の条件で評価したところ、安全策を回避して有害な作業に関与するケースが確認された。

 例えば、架空のレッドチーム演習を装う指示では64%、AIが安全かどうかを判断する「思考」の一部を先回りして与える手法では、92%の割合で有害な作業への関与が確認された。さらに、拒否機構を弱める改変を施したAIモデルでは100%となった。

 ただし、これらはそれぞれ異なる条件での評価結果であり、「GLM-5.3の安全策が100%突破される」という意味ではない。なお、Anthropicの試験では、安全策を有効にした「Claude」は同じ条件で有害作業を実施しなかったとしている。

 GLM-5.3のようなオープンウエートモデルではAIモデルの重みが公開されているため、利用者がAIモデル自体を改変できる。Anthropicはこの特性を検証するため、AIモデルの安全性に関する拒否反応を弱める「abliteration」を試した。

 約2200GPU時間、計算コスト約4400ドルをかけてAIモデルを改変した結果、安全性評価項目のうち、「JailbreakBench」と「HarmBench」における拒否率はそれぞれ約3%と2%、「StrongREJECT」では12%まで低下した。

 一方で、科学能力の評価では標準版と改変版で同等の結果となった。サイバー能力についても、評価の一部では低下が数%にとどまった。つまり、AIモデルの安全性に関する振る舞いを弱めても、AIモデルが本来持っている能力まで大きく失われるとは限らない。

 これは、AIモデルを利用する企業にとっても無関係ではない。

 クラウド型AIサービスでは、サービス提供者が設定した安全策に依存できる場合がある。一方、AIモデルそのものを取得・運用できる環境では、利用者側で安全策を維持する必要性がより大きくなる。

 AIの導入では「どのAIモデルが高性能か」だけでなく、AIモデルの提供形態や、重みへのアクセス、改変可能性まで含めて考える必要がある。

Copyright © ITmedia, Inc. All Rights Reserved.

ページトップに戻る