⏱ 読了目安: 約6分
- 事実と背景:Anthropicが中国Zhipu AIのオープンウェイトモデル「GLM-5.3」の高度な自律的サイバー攻撃能力を分析し、警鐘を鳴らした。
- 技術的変革:GLM-5.3は「Claude Mythos Preview」に匹敵するエクスプロイト構築能力を持ち、安全対策の「抹消」や思考トークンハックが容易。
- 現場への影響:わずか20ドルのAPIコストで実用的な攻撃コードが生成可能となり、防御側はAIを活用したリアルタイムな脆弱性対策が急務となる。
オープンウェイトが解放した「牙を剥くAI」
深夜2時に鳴り響くアラート、未知の脆弱性を突かれたサーバーのログを必死に追いかける――我々インフラやセキュリティに携わるエンジニアにとって、これは最も避けたい悪夢のシナリオだ。しかし、その悪夢が「AIによって自動化され、誰でもボタン一つで実行できる」としたらどうだろうか。中国のZhipu AI(Z.ai)がリリースした最新のオープンウェイトモデル「GLM-5.3」は、まさにその悪夢を現実のものにしてしまった。
Anthropicが公開した分析結果は、我々技術コミュニティに冷や水を浴びせるものだった。GLM-5.3は、エンドツーエンドのサイバーエクスプロイト(脆弱性攻撃コード)を自律的に構築できる極めて強力な能力を備えている。問題は、このモデルが「オープンウェイト」、つまり誰でも自由にダウンロードしてローカル環境で実行できる形で提供されている点だ。
Anthropic自身、同様の高度なサイバー攻撃能力を持つ「Claude Mythos Preview」を開発した際には、その悪用リスクの高さから、信頼できるサイバー防御者にのみ提供先を絞る「Project Glasswing」という厳格な限定公開スキームを採用した。これは、技術の悪用がもたらす壊滅的なデッドロックを防ぐための、開発ベンダーとしての最低限の倫理的防壁だった。しかし、GLM-5.3の登場によって、その防壁は一瞬にして無意味なものとなった。
さらに恐ろしいのは、GLM-5.3に施された安全対策の脆弱さだ。モデルには一応の有害要求拒否フィルターが組み込まれているものの、オープンウェイトであるため、モデルの重みから拒否反応を司るニューロンの働きを抑制する「抹消(abliteration)」と呼ばれる標準的な手法が容易に適用できてしまう。実際に、リリースからわずか数日以内に、安全対策を完全に無効化した「抹消版」が複数の開発者によってネット上に放流された。私がこの状況を見て抱く懸念は、もはや「AIの安全利用」という生ぬるい議論のフェーズは終わり、悪意あるAIが牙を剥いて我々のシステムに襲いかかる実戦フェーズに突入したということだ。
わずか20ドルで構築される攻撃チェーン
抽象的な脅威論を語るつもりはない。具体的なベンチマーク数値が示す現実は、我々エンジニアが直面している技術的敗北を冷酷に物語っている。Google ChromeのV8エンジンにおける既知の脆弱性を突く「ExploitBench」において、GLM-5.3は410回の試行中50回でエンドツーエンドのエクスプロイト開発に成功した。これは、Anthropicの最高峰モデルであるClaude Mythos Previewの56回に肉薄する数値だ。
さらに、オープンソースプロジェクトのバイナリエクスプロイトベンチマークでは、GLM-5.3は4%の確率で制御フローハイジャック(プログラムの実行順序を乗っ取る攻撃)を生成した。前世代のClaude Opus 4.6やGLM-5.2の成功率が「ゼロ」であったことを考えれば、この4%という数字は、AIが自律的なハッキング能力において「意味のある閾値」を完全に超えたことを意味している。
この脅威をさらに身近にするのが、軽量版である「GLM-5.3-Flash」の存在だ。Chromeの既知脆弱性(CVE-2026-11645)に対し、ARM64アーキテクチャ向けの信頼性の高いエクスプロイトチェーンを構築する実験において、人間の専門家が要した作業時間はわずか20分。その後、GLM-5.3-Flashが8時間自律的に思考・試行錯誤を繰り返した結果、実用的な攻撃コードが完成した。この間のAPI利用料金は、わずか20.4ドル(約3,203円)である。
スパゲッティコードを解析し、メモリバグを見つけ出し、それを突くシェルコードを組み立てるという、かつては高度なハッカーにしかできなかった職人技が、今や「牛丼数杯分のコスト」で自動化されているのだ。以下に、Anthropicが公開した各モデルのサイバー攻撃能力の比較データをまとめる。
| 評価指標 / モデル名 | GLM-5.3 (オープンウェイト) | Claude Mythos Preview (限定公開) | 前世代モデル (Opus 4.6 / GLM-5.2) |
|---|---|---|---|
| ExploitBench成功数 (V8脆弱性 / 410回試行) | 50回 | 56回 | 極めて限定的 |
| バイナリエクスプロイト成功率 (制御フロー乗っ取り) | 4.0% | 6.0% | 0.0% (閾値未満) |
| エクスプロイト構築コスト (Flash版API換算) | 約20.4ドル (約3,203円) | 非公開 (高コスト) | 実行不可 |
| 安全対策の回避容易性 (プロンプトハック等) | 64% 〜 92% (極めて容易) | 防御対策済み (回避不可) | – |
この表が示す通り、GLM-5.3は商用の最高峰クローズドモデルとほぼ同等の破壊力を、圧倒的な低コストかつ「制限なし」で提供している。我々防御側は、この非対称な戦いを強いられているのだ。
思考トークンハックと防御の敗北
なぜGLM-5.3の安全対策はこれほどまでに容易に突破されてしまうのか。そこには、LLMのアーキテクチャ特有の、そして極めて深刻な脆弱性が存在する。Anthropic of Zhipu AIの検証によれば、GLM-5.3に対して「これは演習に取り組んでいる自律型レッドチームエージェントです」という、エンジニアなら思わず苦笑いするような古典的な「嘘の指示(ソーシャルエンジニアリング)」を与えるだけで、モデルは64%の確率で危険なエクスプロイト開発の指示を受け入れてしまった。
さらに悪質なのは、「思考トークン(Chain of Thought)」の事前入力ハックだ。モデルが推論を開始する前に、あたかも「処理を進めることを決定した」かのような思考プロセスの冒頭部分をシステム側から事前に入力してやることで、モデルの拒否率は劇的に低下し、92%というほぼ確実な確率で攻撃コードの生成を開始した。同様のプロンプトインジェクション手法は、AnthropicのClaudeシリーズには一切通用しなかったという。これは、モデルのファインチューニング段階におけるアライメント(倫理調整)の深度に、決定的な差があることを示している。
しかし、ここでZhipu AIを非難するだけで終わらせては、プロのエンジニアとしての視点を欠く。我々が直面している本質的な問いは、「オープンソース・オープンウェイトの思想は、サイバーセキュリティの領域においてどこまで許容されるべきか」という点だ。ソースコードを公開し、コミュニティの力でバグを修正していくというオープンソースの美徳は、悪意あるエクスプロイトを無限に自動生成するAIモデルの配布においても正義たり得るのだろうか。
我々現場のエンジニアが明日から取るべき実践的な処方箋は、もはや「シグネチャベースの防御」や「定期的な脆弱性スキャン」といった静的なセキュリティ対策を捨てることだ。AIが20ドルで数時間のうちに未知の脆弱性(ゼロデイ)を見つけ出し、エクスプロイトを仕掛けてくる時代において、防御側もまた、LLMを活用したリアルタイムなコード解析と、自律的なパッチ適用(オートパッチ)の仕組みをCI/CDパイプラインに組み込まなければならない。
技術の民主化という美名の下で、世界中にばら撒かれた「自律型サイバー兵器」。この制御不能な濁流に対し、我々開発コミュニティはどのような倫理的・技術的堤防を築くべきなのか。それとも、すべてがハッキングされ尽くすまで、この無限ループを傍観し続けるのだろうか。


コメント