検証では物語形式や学術的な文体も利用された。悪意ある質問を架空のシナリオや査読作業、分類学の議論などとして提示することで、安全判定機構の判断に影響を与えたとされる。
報告によれば、モデルの意図判定システムは分析目的や教育目的と解釈できる形式の質問に対し、制限が比較的緩やかになる傾向を示したという。この特徴を利用し、検証では危険な内容を研究目的や解説目的に見せかけた。
通常の学習データ分布から外れた特殊なトークンや、構造化文書の推論機能も組み合わせられた。こうした技法の併用によって、安全対策を突破できる可能性が高まったと報告されている。
セキュリティ分野の専門家は、この事例がAI安全性に関する広範な課題を示していると指摘する。多様な言語表現や長期的な会話文脈に対し、一貫したポリシー適用を実現することは依然として難しい問題だ。
LLMの能力向上に伴い、攻撃者がAIシステムそのものを標的として検証する動きも活発化している。これは従来のソフトウェア製品における脆弱性調査と同様の発想であり、AIモデルも敵対的テストの対象になりつつあることを示している。
現時点で、Claude Fable 5が実際のサイバー攻撃に悪用された証拠は確認されていない。しかし機微な手順的知識を引き出せる可能性が示されたことで、脆弱性悪用手法の開発やソーシャルエンジニアリング、マルウェア設計などへの転用を懸念する声が出ている。
今回の報告は、現行のガードレール実装が抱える限界を浮き彫りにした。単純なキーワード検出や意図分類だけでは、多様な表現や複雑な文脈操作に十分対応できない可能性が示された形だ。
Anthropicは記事掲載時点で、今回の具体的な主張に関する詳細な見解を公表していない。ただし、この事例は次世代AIシステムにおける研究利用の有用性、公開性、安全性、不正利用防止策の均衡を巡る議論をいっそう活発化させる可能性がある。
「サイバー攻撃は日々高度化・複雑化」は聞き飽きた? 企業が陥る「複雑化のわな」
「パッチパンデミック」で現場が阿鼻叫喚 フロンティアAI時代の脆弱性管理“新常識”
メモ帳にコピペしても消えない? Claudeが文章に仕込む“見えないAIマーク”
平和ボケの代償? ニチレイショックの裏で進行する“ド級のデータ漏えい”
Claude暴走、企業に侵入 AnthropicとOpenAIの事例から学ぶ3つの教訓Copyright © ITmedia, Inc. All Rights Reserved.