Figmaが実践するAIエージェントによるセキュリティ自動化の深層

AI・テクノロジー
STΛCKHUB ANALYSIS2026.09.06 17:01

アラート疲労を打破するAIエージェントの衝撃

深夜2時、突然鳴り響くオンコールの通知。眠い目をこすりながらダッシュボードを開き、膨大なログの海から真の脅威を特定しようと格闘する――。この「アラート疲労」は、現代のセキュリティエンジニアにとって避けて通れない悪夢です。しかし、Figmaのエンジニアリングチームが公開した事例は、この泥沼の戦いに終止符を打つ可能性を示唆しています。彼らは、単なる自動化スクリプトの域を超えた「AIエージェント」を導入し、セキュリティ運用を根本から変革しました。

Figmaが構築したシステムは、Panther SIEMを中核に据え、AWS、Okta、GitHub、GCP、そしてosqueryといった100以上のソースからデータを収集・分析します。特筆すべきは、Claude OpusのようなLLMを活用した「トリアージエージェント」の存在です。このエージェントは、Slackの過去のやり取り、独自のステアリングメモリ、そしてセキュリティエンジニアが必要とするツールセットを統合的に扱い、複雑なアラートの解決時間を約70%も短縮しました。さらに、オンコール対応の頻度自体も20%削減することに成功しています。これは単なる効率化ではなく、エンジニアの認知負荷を劇的に下げ、より創造的なセキュリティ設計に時間を割ける環境を構築したことを意味します。

彼らのアプローチで最も興味深いのは、「メモリ」の設計です。過去のアラート、行動ガイダンス、データベース構造という3種類のメモリを分離して管理することで、エージェントは経験を積み、時間の経過とともに精度を向上させています。これは、単発のプロンプトエンジニアリングで終わらせず、システム全体を「学習する組織」へと昇華させるための極めてエンジニアリング的な解法です。我々が直面するスパゲッティ化したログデータも、適切なコンテキストとメモリ構造を与えれば、AIにとっての「宝の山」に変わるという事実を、彼らは証明してみせたのです。

脆弱性検知の精度を極めるための戦略的アプローチ

「AIにコードレビューを任せたら、誤検知ばかりでかえって工数が増えた」――そんな嘆きを耳にすることは少なくありません。Figmaの事例が示唆するのは、AI導入における「精度の優先順位」という冷徹な現実です。彼らは、AIエージェントを活用して100以上の未知の脆弱性を発見し、その中には従来の静的解析ツールでは見抜けなかった2つの致命的な欠陥も含まれていました。この成果を支えたのは、「リコール(網羅性)よりもプレシジョン(精度)を優先する」という戦略的判断です。

多くのエンジニアは、AIに「とにかく全てを見つけてほしい」と願いがちですが、Figmaのチームは逆のアプローチをとりました。過去のバグデータはリコールを測定するには適していますが、精度を向上させるには不十分です。彼らは、まずAIの判断精度を極限まで高めることに注力し、その結果としてコードレビューの精度を1ヶ月で80%まで引き上げました。さらに、二段階のレビュープロセスを導入することで、既知のバグ検知率を30%向上させ、コーディングエラーを50%削減するという驚異的な数値を叩き出しています。

このプロセスにおいて、彼らが採用した技術スタックは非常に堅牢です。AWS Bedrock Knowledge Bases、Amazon Kendra、Tines、そしてSnowflakeを組み合わせ、エージェントが自律的に調査を行い、必要に応じてプルリクエスト(PR)を作成します。ただし、ここには「安全装置」が組み込まれています。エージェントが作成したPRはデフォルトで「ドラフト」状態となり、機密情報がSlackなどのパブリックチャンネルに漏洩しないよう、プロンプトレベルで厳格に制御されています。これは、AIを「信頼する」のではなく、「検証可能な枠組みの中で泳がせる」という、DevSecOpsの理想形に近い実装です。

指標 改善効果
複雑なアラート解決時間 約70%短縮
オンコール対応頻度 20%削減
コードレビュー精度 1ヶ月で80%到達
既知のバグ検知率 約30%向上
コーディングエラー 約50%削減

AI時代のセキュリティ:人間はどこで判断を下すべきか

Figmaの成功は素晴らしいものですが、我々エンジニアはここで立ち止まって考える必要があります。Wizが報告した「GhostApproval」のように、AIコーディングアシスタントが巧妙な攻撃によって悪意のあるリポジトリを承認させてしまうリスクは、依然として現実の脅威です。AIエージェントが自律的にシステムを操作し、PRを生成する世界において、「人間による承認」は単なる儀式と化していないでしょうか?

Figmaのチームは、AIエージェントが完璧ではないことを認めつつ、人間もまた完璧ではないと指摘しています。重要なのは、AIか人間かという二元論ではなく、両者の「責任の境界線」をどこに引くかという点です。AIが生成したコードや調査結果を、人間が「なんとなく」承認するフローは、最も危険な脆弱性になり得ます。我々が明日から取るべき対策は、AIの出力を盲信するのではなく、AIが「なぜその判断に至ったか」という推論プロセスを可視化し、人間がその論理を検証できる「監査可能なパイプライン」を構築することです。

結局のところ、AIエージェントは我々の仕事を奪う存在ではなく、我々の「判断の質」を問う鏡です。あなたが今、AIに任せているそのタスクは、本当にAIが判断すべきものですか? それとも、AIの判断を検証するための「人間側のチェックリスト」が欠落していませんか? 技術が進化するほど、エンジニアに求められるのは「コードを書く能力」から「AIの推論をハックし、制御する能力」へとシフトしています。この変化の波の中で、あなたは自らの専門性をどう再定義し、AIという強力なエージェントを使いこなす準備ができていますか?

Published at 17:01

コメント

タイトルとURLをコピーしました