初めて記録されたAIによるサイバー攻撃は2025年9月に発生した。中国政府が支援するグループがClaude Codeを操作し、金融機関、政府機関、化学メーカーなど世界約30の標的へ侵入した。これは理論上の演習ではない。Anthropicの開示資料によれば、攻撃者は自律型AIエージェントが人的介入をほとんど必要とせず大規模に兵器化可能であることを実証した。これはセキュリティチームが防御準備を整えるべき新たなカテゴリーの高度な持続的脅威(APT)である。セキュリティチームにとってメッセージは明確だ:エージェント型AIセキュリティは新たな懸念事項から運用上の必須要件へと移行した。
その影響は甚大だ。ガートナーは、2025年に5%未満だった企業アプリケーションの40%が、2026年末までにタスク特化型AIエージェントを統合すると予測している。しかしIT専門家の80%は、既にAIエージェントが許可されていない、あるいは予期せぬ行動を実行するのを目撃している。導入速度とセキュリティ成熟度の間のギャップは、攻撃対象領域を生み出し、敵対者が積極的に悪用している。
本ガイドは、セキュリティ専門家に対し、自律型AIの脅威に関する包括的な理解、評価のためのフレームワーク、および自律システムを保護するための実践的な実装ガイダンスを提供します。
エージェント型AIセキュリティとは何か?
エージェント型AIセキュリティとは、自律的なAIエージェントをサイバー脅威から保護すると同時に、定義されたセキュリティ境界内で安全に動作するよう確保するプロセスです。人間の確認のために出力を生成する従来のAIアプリケーションとは異なり、エージェント型AIシステムは、企業リソースに自律的にアクセスし、外部ツールを使用し、ワークフローを実行し、現実のビジネスに影響を与える意思決定を行うことができます。これらのシステムのセキュリティを確保するには、ID、メモリ、ツール、API、実行時の挙動など、エージェントのエコシステム全体を保護する必要があります。
中核的なセキュリティ課題は、自律性と制御のバランスを取りつつ信頼境界を維持することにある。AIエージェントがデータベースへのアクセス、文書の作成、外部関係者へのメール送信を自律的に決定できる場合、従来の入力出力検証では不十分となる。セキュリティチームはツール、メモリ、オーケストレーションロジック、ID権限を含むエージェントのエコシステム全体を考慮しなければならない。
なぜ今これが重要なのか?急速な普及の勢いにより、ほとんどの企業は18か月以内に複数のAIエージェントを運用することになる。今、セキュリティ基盤を確立できない組織は、エージェントの導入が業務機能全体に拡大するにつれて、複合的なリスクに直面することになる。
主体性を持つAI対従来のAIセキュリティ
従来型AIシステムとエージェント型AIシステムのセキュリティ確保における根本的な差異は、アーキテクチャと能力に起因する。
従来のAIセキュリティは、モデルの完全性、トレーニングデータの保護、推論時の攻撃に焦点を当てています。攻撃対象領域は比較的限定されています。入力が投入され、出力が生成されます。セキュリティ対策は、敵対的入力によるモデル予測の操作を防止し、トレーニングパイプラインが侵害されないことを保証することに重点を置いています。
エージェント型AIは攻撃対象領域を劇的に拡大する。これらのシステムは動的な道具使用、多段階推論連鎖、外部通信、セッションを跨いだ永続的記憶を備え、サイバーキルチェーンと同様のパターンを示す。攻撃者は基盤モデルを侵害する必要はない。エージェント生態系の任意の構成要素を操作することで、行動を悪意ある結果へと誘導できる。
表1:従来型AIとエージェント型AIのセキュリティ考慮事項の比較
| アスペクト |
従来型AI |
能動的AI |
| アタックサーフェス |
モデルの入力と出力 |
エージェントのエコシステム全体(ツール、メモリ、オーケストレーションを含む) |
| 主要な脅威 |
敵対的入力、モデルポイズニング |
目標乗っ取り、ツール悪用、ID不正利用、メモリ汚染 |
| 管理境界 |
明確に定義された入出力 |
動的、文脈依存 |
| アイデンティティモデル |
呼び出し元アプリケーションから継承 |
独立した非人間的なアイデンティティガバナンスが必要 |
| 現実世界への影響 |
予測誤差 |
業務上の結果を伴う不正行為 |
| 監視手法 |
入力/出力の検証 |
振る舞い 、意思決定の記録、行動制約 |
セキュリティ上の影響は甚大である。従来のAIセキュリティ対策はモデル層に焦点を当てていたが、エージェント型システムにおいては必要ではあるものの不十分である。セキュリティチームは可視性と制御をエージェントアーキテクチャ全体に拡大しなければならない。
なぜ「エージェント型AI」のセキュリティが重要なのか?
自律型AIセキュリティが優先課題となっているのは、自律型AIエージェントが企業のシステム、ID、API、クラウドサービス、および機密データと直接やり取りを行うためである。人間の確認のために出力を生成する従来のAIアプリケーションとは異なり、自律型システムは独自にアクションを実行できるため、攻撃者がワークフローを操作したり、権限を悪用したり、企業環境内で横方向に移動したりする機会を生み出してしまう。
組織がAIエージェントをさらに導入するにつれ、そのID、動作、および相互作用を保護することは、ユーザー、エンドポイント、クラウドワークロードを保護することと同様に重要になってきています。
主体性を持つAIセキュリティの仕組み
エージェント型AIシステムのアーキテクチャを理解することで、セキュリティ制御を適用すべき箇所が明らかになる。現代のAIエージェントは、運用上の攻撃対象領域を形成する4つの主要コンポーネントを統合している。
エージェントアーキテクチャコンポーネント:
- モデル層:推論能力を提供する基盤となる大規模言語モデル
- ツール層:エージェントが呼び出せる外部機能(API、データベース、ファイルシステム、通信チャネルを含む)
- メモリ層:エージェントがセッション間でコンテキストを維持できる永続ストレージ
- オーケストレーション層:計画、ツール選択、実行フローを調整するロジック
各層は固有の脆弱性を有する。攻撃者は自らの目的達成に最も抵抗の少ない経路を提供するコンポーネントを標的とする。
致死的な三連発の解説
セキュリティ研究者のサイモン・ウィリソンは、組み合わさると深刻なリスクを生み出す 3 つの要素を特定しました。マーティン・ファウラーは、このフレームワークについて技術的な分析で詳しく説明しています。このフレームワークを理解することで、セキュリティチームは、どのエージェントの展開に最も厳格な制御が必要かを特定しやすくなります。
致死的な三連打は次の3つで構成される:
- 認証情報、トークン、ソースコード、内部文書、個人を特定できる情報など、データ漏洩を可能にする機密データへのアクセス
- 信頼できないコンテンツへの接触(公開リポジトリ、ウェブページ、ユーザー入力、メール添付ファイル、サードパーティ統合などからのソースを含む)
- 外部との通信機能(メール送信、API呼び出し、チャットメッセージ、ファイル操作、コード実行を含む)
3つの条件が同時に存在する場合、リスクは劇的に増大する。認証情報にアクセス可能なエージェントが、信頼できない電子メール添付ファイルを処理し、外部通信を送信できる場合、データ漏洩、認証情報の窃取、サプライチェーン侵害への経路が形成される。
すべてのエージェント展開がこれら3つの特性をすべて示すわけではありません。セキュリティチームは、各展開をこれらの基準に対して評価し、リスクプロファイルに見合った制御を実施すべきです。
エージェントのアーキテクチャと攻撃対象領域の理解
攻撃者は、目的やエージェントの設定に応じて異なるレイヤーを悪用する。
モデル層攻撃:
- Prompt injection 、エージェントの入力に悪意のある命令がPrompt injection
- 脱獄は、基盤となるモデルに組み込まれた安全制約を無効化しようとする試みであり、従来のエクスプロイト技術と同様である
ツールレイヤー攻撃:
- ツールの誤用とは、正当なツールの機能を不正な目的に悪用することである
- スコープ拡張はエージェントを騙し、意図された境界を超えてツールを使用させる
- リソースの乱用は、反復的な呼び出しによってコンピューティングリソースやAPIクォータを消費します
メモリ層攻撃:
- メモリ汚染は永続的なコンテキストを改竄し、将来の決定に影響を与える
- 文脈操作は、エージェントが権威ある情報として扱う虚偽の情報を挿入する
オーケストレーション層への攻撃:
- 目標乗っ取りは、攻撃者が制御する結果に向けてエージェントの目的を転向させる
- ワークフロー操作は承認ステップをバイパスするため実行ロジックを変更する
AWSエージェント型AIセキュリティスコープマトリクスは、接続性(低または高)と自律性(低または高)という2つの次元に基づいてエージェント展開を分類するフレームワークを提供します。これにより4つのスコープが生成され、それぞれ異なるセキュリティ制御強度が必要となります。
AWS スコープマトリックス概要:
- スコープ1(低接続性、低自律性):ツールへのアクセスが制限された内部エージェント。基本的な入力検証とログ記録で十分。
- スコープ2(高接続性、低自律性):人間の監視下にあるインターネット接続エージェント。ネットワークセグメンテーションとAPIセキュリティが必要。
- スコープ3(低接続性、高自律性):独立した行動能力が顕著な内部エージェント。行動制約と承認ワークフローが必要。
- スコープ4(高接続性、高自律性):インターネット接続型自律エージェント。完全なzero trust 継続的監視が必要。
組織はスコープ1または2から展開を開始し、セキュリティ成熟度を実証した後にのみ上位のスコープへ移行すべきである。このスコープマトリクスは、OWASP、CoSAI、および複数の業界標準化団体によって基礎的な枠組みとして参照されている。
Anthropicが導入した新たなモデルコンテキストプロトコル(MCP)は、エージェントとツール間の通信のための標準化されたインターフェースを提供する。MCPは相互運用性を向上させる一方で、新たな攻撃ベクトルも生み出す。セキュリティチームはMCPサーバーの完全性を検証し、エージェントと接続ツール間の横方向移動を監視しなければならない。
エージェント型AIのセキュリティライフサイクル
エージェント型AIのセキュリティ確保は、単発の活動ではなく、自律型AIエージェントの計画、導入、運用、および廃止にわたる継続的なライフサイクルです。各段階には固有のセキュリティ上の考慮事項があり、継続的なガバナンス、監視、および検証が必要となります。
典型的なエージェント型AIのセキュリティライフサイクルには、以下の6つのステップが含まれます:
設計とリスク評価– 展開に先立ち、エージェントの目的、信頼境界、自律レベル、およびアクセス要件を定義する。
IDおよびアクセスプロビジョニング– エージェントに、最小権限の権限、認証制御、および承認ポリシーを備えた、人間以外の専用IDを割り当てます。
導入と統合– 構成およびサプライチェーンの完全性を検証しつつ、モデル、ツール、API、メモリストア、およびエンタープライズアプリケーションとの安全な統合を実現します。
実行時の監視と行動検知– エージェントの動作、ツールの使用状況、ID関連の活動、および通信を継続的に監視し、prompt injection、目標の乗っ取り、権限の悪用、メモリポイズニング、その他の異常な動作を特定します。
インシデント対応と復旧– 不審なエージェントの活動を調査し、侵害されたIDやツールへのアクセス権を無効化し、信頼できる設定を復元し、悪意のある動作が封じ込められたことを確認します。
継続的な改善– エージェントの進化や新たな脅威の出現に伴い、ガードレールの見直し、ポリシーの更新、検知モデルの再学習、権限の見直しを行い、得られた教訓を反映させる。
主体性を持つAIのセキュリティリスクと脅威
2025年12月に発表された「エージェント型アプリケーション向けOWASPトップ10 2026」は、エージェント型AIシステム向けの業界標準脅威分類体系を確立する。100名以上のセキュリティ研究者の意見を取り入れ、Microsoft、NVIDIA、AWS、GoDaddyが参照するこのフレームワークは、エージェント型AIのセキュリティリスクに対する権威ある分類を提供する。
OWASP エージェント型アプリケーション向けトップ10 2026年版
OWASP Top 10 for Agentic Applications の完全版では、以下のリスクカテゴリを特定しています:
- ASI01 - エージェントの目標乗っ取り:攻撃者はprompt injection コンテキストの操作を通じてエージェントの目標を操作し、正当な機能を悪意のある結果へと誘導する
- ASI02 - ツールの悪用:エージェントツールを不正な行動に利用すること。これには意図された範囲を超えた権限拡大が含まれる。
- ASI03 - 身元と特権の悪用:過剰な権限の悪用、認証情報の窃取、または人間の身元のなりすましによるアカウント乗っ取り
- ASI04 - メモリ汚染:永続エージェントのメモリを改ざんし、将来の決定に影響を与え、連鎖的な障害を引き起こす
- ASI05 - データ漏洩:エージェント出力、ログ、またはツール応答を通じた機密データの不正取得
- ASI06 - サプライチェーンの脆弱性:ツール、プラグイン、MCPサーバー、依存関係を含むエージェントコンポーネントの侵害(広範なサプライチェーン攻撃の一環として)
- ASI07 - 入力操作:エージェントの解析または処理ロジックを悪用する巧妙な入力
- ASI08 - 過剰な自律性:適切な監督なしに適切な範囲を超えたエージェントの行動
- ASI09 - 不十分な記録と監視:悪意あるエージェントの振る舞い検知を妨げる不十分な可観測性
- ASI10 - 不安全な出力処理:下流の攻撃を可能にしたり、セキュリティ制御をバイパスしたりするエージェントの出力
表2: 2026年エージェント型アプリケーション向けOWASPトップ10
| リスクID |
名前 |
影響レベル |
一次的緩和 |
| ASI01 |
エージェント目標乗っ取り |
クリティカル |
入力検証、目的制約 |
| ASI02 |
工具の誤用 |
高い |
ツールの許可リスト、スコープ制約 |
| ASI03 |
アイデンティティと特権の乱用 |
クリティカル |
最小権限、継続的認証 |
| ASI04 |
メモリ汚染 |
高い |
メモリ分離、完全性検証 |
| ASI05 |
データ漏洩 |
高い |
出力フィルタリング、DLP統合 |
| ASI06 |
サプライチェーンの脆弱性 |
クリティカル |
ベンダー検証、SBOM |
| ASI07 |
入力操作 |
ミディアム |
入力のサニタイズ、型検証 |
| ASI08 |
過剰な自律性 |
ミディアム |
段階的自律化、承認ワークフロー |
| ASI09 |
ログ記録が不十分 |
ミディアム |
包括的なテレメトリ、監査証跡 |
| ASI10 |
安全でない出力処理 |
ミディアム |
出力検証、下流工程の管理 |
エージェント型AIシステムを運用するすべてのセキュリティチームは、これらのリスクカテゴリーに基づいて展開状況をマッピングし、適切な制御を実施すべきである。
能動的システムPrompt injection
Prompt injection 、エージェントが改ざんされた指示に基づいて行動してしまう可能性があるため、エージェントが関与する状況において特に危険な脅威Prompt injection 。
ダイレクトprompt injection、ユーザー入力に悪意のある命令を直接挿入する攻撃手法です。攻撃者は、エージェントの本来の命令を上書きし、新たな目的を強制するような入力を仕組む可能性があります。
間接的なprompt injection、より悪質です。攻撃者は、エージェントが取得するコンテンツに隠された命令を埋め込みます。ドキュメント、電子メール、Webページ、データベースのレコードなど、あらゆるものにペイロードが仕込まれており、エージェントがそれらを処理した際に発動します。
二次プロンプトはマルチエージェントアーキテクチャを悪用する。ServiceNow Now Assistに対する既知の攻撃では、攻撃者は初期処理エージェントには無害に見えるデータフィールドに悪意のある指示を埋め込み、より高い特権を持つエージェントに処理が渡された際に作動させた。
OpenAIは2025年12月、prompt injection アーキテクチャレベルでは完全には解決できないprompt injection 述べた。AI開発の第一人者によるこの認識は、単一の対策に依存するのではなく、多層的な防御体制が必要であることを改めて浮き彫りにしている。
78件の研究を対象としたメタ分析によると、prompt injection 成功率は85%を超えていることが判明した。安全対策を強化して設計されたClaude Opus 4.5でさえ、Anthropicによるテストでは、標的型攻撃に対して30%以上の成功率を示した。
実務上の教訓:組織はモデルレベルの防御策だけに頼ることはできない。実行時のガードレール、出力の検証、および振る舞い 、不可欠な補完手段である。間接的なprompt injection フィッシング 攻撃を大規模に可能にし、一見正当なエージェントとのやり取りを通じて、認証情報や機密データを抽出してしまう。
メモリ改ざん攻撃
メモリポイズニングは、セッションをまたいで状態を維持するエージェント型システムに特有の新興脅威である。
攻撃メカニズムは、エージェントの永続メモリを虚偽または悪意のある情報で汚染することを含む。エージェントは保存されたコンテキストを権威あるものと扱うため、汚染されたメモリは繰り返し悪用を必要とせずに将来の決定に影響を与える。
ガリレオAIが2025年12月に発表した研究によると、初期のメモリ汚染から4時間以内に下流の意思決定の87%が損なわれることが実証された。この連鎖効果により、単一の汚染成功事例が数百に及ぶ後続のエージェント相互作用に影響を及ぼし得る。
2024年8月に発生したSlack AIのデータ流出インシデントは、メモリポイズニングが実際に機能することを実証しました。研究者らは、非公開のSlackチャンネルに間接的なprompt injection 埋め込みました。Slack AIアシスタントがこれらのチャンネルを処理すると、会話の要約が攻撃者が制御する宛先へと流出され始めました。これは、AIによって可能となったインサイダー脅威の一形態であり、エージェントが知らず知らずのうちにデータ窃盗の共犯者となってしまうケースです。
メモリ汚染を軽減するには、信頼ドメイン間のメモリ分離、保存されたコンテキストの整合性検証、およびメモリ侵害を示唆する異常な決定パターンを検知するための動作監視が必要です。
非人間アイデンティティ管理(AIエージェント向け)
企業セキュリティにおいて最も急速に拡大している攻撃対象領域は、非人間的アイデンティティ(NHI)である。世界経済フォーラムの分析によれば、現代企業におけるNHIと人間のアイデンティティの比率は50:1に達し、2年以内に80:1に達すると予測されている。AIエージェントは新たなカテゴリーのNHIを構成し、専用のセキュリティガバナンスを必要とする。
業界データによると、AI関連のデータ侵害の97%は不十分なアクセス管理に起因している。2026年1月にCrowdStrikeがSGNLを7億4000万ドルで買収したことは、主要セキュリティベンダーがエージェント型AIを本質的にアイデンティティ問題と認識していることを示している。
従来の、呼び出し元ユーザーに基づいてエージェント権限を割り当てる手法は、過剰な特権の露出を引き起こす。研究タスクを実行するエージェントは、金融取引を処理するエージェントと同じアクセス権を必要としない。たとえ両方を同じユーザーが呼び出した場合でも同様である。
AIエージェント向けアイデンティティガバナンスの実装
AIエージェントに対する効果的なNHIガバナンスには、それらを独立したライフサイクル管理を持つ第一級のアイデンティティとして扱うことが必要である。
アイデンティティのライフサイクル段階:
- 作成:明確な所有権、目的文書、および初期許可範囲をもってエージェントの身元を確立する
- 管理:定期的なアクセス権限の見直し、変化する要件に基づく権限調整
- 監視: アイデンティティ分析による 振る舞い を通じた検知
- 廃止:監視なしに活動し続けるゾンビエージェントを防ぐための正式な終了手順
ガバナンス原則:
- 最小権限の原則:特定のタスクに必要な最小限の権限のみを付与し、包括的なアクセス権限を与えない
- ジャストインタイムアクセス:時間制限付きの権限で、自動的に失効し、継続的なアクセスには再認証が必要となる
- 継続的認可:エージェントが操作全体を通じて許可された範囲内に留まっていることをリアルタイムで検証する
- 独立したガバナンス:エージェント権限とユーザー権限を分離し、明確なレビューサイクルを設ける
ゾンビエージェント問題は特に注意を要する。実験や概念実証のために起動されたエージェントは、プロジェクト終了後も稼働し続けることが多い。これらのエージェントはアクセス権を維持し、リソースを消費し、所有者や監視なしに攻撃対象領域を拡大する。正式な廃止手続きは、あらゆるエージェント展開ライフサイクルに組み込まれる必要がある。
実世界の事例とケーススタディ
エージェント型AIに対する脅威の状況は、理論的な段階から運用段階へと移行した。主要な企業向けプラットフォームにおいて、CVSSスコアが9.0を超える重大な脆弱性が発見され、そのうちのいくつかは実際に悪用されている。
自律型AIシステムにおける重大なCVE(2025-2026年)
表3:主体性を持つAIシステムにおける重大な脆弱性(2025-2026年)
ServiceNow ボディスナッチャー (CVE-2025-12420)
ServiceNowのAIプラットフォームで発見されたBodySnatcher脆弱性により、認証されていない攻撃者はメールアドレスのみを使用して管理者を含む任意のユーザーをなりすますことが可能でした。この攻撃手法はハードコードされた認証シークレットと緩いアカウント連携機能を利用し、MFA(多要素認証)とSSO(シングルサインオン)を迂回。攻撃者がAIワークフローを実行し、昇格された権限を持つバックドアアカウントを作成することを可能にしました。影響を受けるVirtual Agent APIバージョンを運用中の組織は、直ちにパッチ適用状況を確認すべきです。
Langflow脆弱性連鎖 (CVE-2025-34291)
人気のあるオープンソースAIエージェントフレームワーク「Langflow」には、完全なアカウント乗っ取りとリモートコード実行を可能にする重大な脆弱性連鎖が存在した。過度に寛容なCORS設定と、CSRF保護の欠如、安全でないコード検証エンドポイントが組み合わさり、攻撃経路を形成した。保存されたすべてのアクセストークンとAPIキーが漏洩し、統合された下流サービス全体にわたる連鎖的な侵害を可能にした。Flodricボットネットはこの脆弱性を積極的に悪用している。
Microsoft Copilot EchoLeak (CVE-2025-32711)
EchoLeak脆弱性は、AIエージェントに対する初の記録されたゼロクリック攻撃である。攻撃者はWord、PowerPoint、Outlook文書内の隠しテキスト、スピーカーノート、メタデータ、またはコメントに悪意のあるプロンプトを埋め込む。被害者がCopilotとやり取りする際、電子メール、OneDriveファイル、SharePointコンテンツ、Teamsメッセージを含む機密組織データが、ユーザーの認識や操作なしに画像URLパラメータ経由で流出する。
初のAIが指揮したサイバー攻撃
2025年9月、Anthropicは、人間の介入をほとんど受けずに実行された初の記録された大規模サイバー攻撃をAIエージェントが引き起こしたことを公表した。中国政府が支援するグループがClaude Codeを操作し、金融サービス、政府、重要インフラ分野の約30の組織を対象に偵察活動、標的選定、侵入試行を行った。
ファントムレイヴン・サプライチェーン攻撃
Koi Securityは、新たな「リモート動的依存関係」技術を用いて126の悪意あるnpmパッケージを発見した。これらのパッケージはレジストリ上では空で無害に見えたが、インストール後に攻撃者サーバーから悪意あるペイロードを取得した。スロープスクワッティングと呼ばれる手法でAIが生成した架空の名前を使用し、検知されるまでに86,000回以上ダウンロードされ、npmトークン、クラウド認証情報、SSHキーを漏洩させた。
これらのインシデントには、AIエージェントの攻撃ベクトルを特に考慮した強固なインシデント対応能力が求められます。セキュリティチームは、エージェント固有の調査手順を含めるようプレイブックを更新すべきです。
能動的AIの脅威の検知と防止
MITスローン・スリー・エッセンシャルズ・フレームワークは、主体的なAIセキュリティに対する体系的なアプローチを提供する。組織は包括的な脅威モデリング、継続的なセキュリティテスト、および連携して機能する実行時保護を実装しなければならない。
セキュリティ責任者のわずか21%が、AIエージェントの運用状況を完全に把握していると報告している。定期的なAIセキュリティテストを実施しているのは40%未満である。この可視性のギャップはリスクであると同時に、脅威検知能力の向上を通じて組織を差別化するセキュリティチームにとっての機会でもある。
AWSスコープマトリクスによるセキュリティ制御範囲
制御をアーキテクチャの複雑さに適合させることで、正当な運用を妨げることなく、比例した保護を確保する。
スコープ1(低接続性、低自律性):
- 基本的な入力検証とサニタイズ
- エージェントの動作に関する包括的なログ記録
- 機密データの出力フィルタリング
スコープ2(高接続性、低自律性):
- エージェントインフラを分離するネットワークセグメンテーション
- APIセキュリティ(認証およびレート制限を含む)
- 外部通信の監視
スコープ3(低接続性、高自律性):
- エージェントの能力を定義された境界に制限する動作制約
- 影響力の大きい決定事項に対する承認ワークフロー
- 獲得した信頼に基づく段階的自律性の拡大
スコープ4(高接続性、高自律性):
実行時ガードレールの実装
階層化されたランタイム保護は、エージェント動作の各段階で脅威に対処します。
入力層の保護:
- 悪意のある命令パターンを検出するPrompt injection
- 入力から潜在的に危険なペイロードを除去するコンテンツフィルタリング
- スキーマ検証により、入力が期待される形式に合致することを保証する
アクションレイヤー保護:
- ツールの許可リストによるエージェントの機能セット制限
- 定義された境界を超えて能力を拡張することを妨げる範囲の制約
- リソースの乱用を防ぐためのレート制限(過度なツール呼び出しによる)
出力層の保護:
- 個人識別情報の検知とマスキングによる不注意なデータ漏洩の防止
- 機密データのフィルタリング:出力から認証情報とトークンを除去する
- 応答検証により、出力結果が下流の攻撃を可能にしないことを保証する
ベンダーソリューションには、NVIDIA NeMo Guardrails、F5、Straikerなどによる商用実装が含まれます。組織はまた、特定の要件に適したオープンソースフレームワークを使用してカスタムガードレールを構築することも可能です。
行動検出が主体性を持つAIにとってなぜ重要なのか?
プロンプトのフィルタリング、実行時のガードレール、承認ワークフローなどの予防的対策により、AIエージェントの悪用リスクは低減されますが、すべての攻撃を阻止できるわけではありません。Prompt injection、ツールの侵害、認証情報の盗難、メモリポイズニング、IDの悪用などにより、自律型エージェントはデプロイ後に予期せぬ動作や不正な動作を行う可能性があります。
行動検知は、AIエージェントがID、API、エンタープライズアプリケーション、クラウドサービス、および他のAIエージェントとどのようにやり取りしているかを継続的に監視することで、予防的な制御を補完します。行動分析では、プロンプトや出力を個別に評価するのではなく、エージェントの想定される活動のベースラインを確立し、目標の乗っ取り、不正なツールの使用、過度な権限の行使、データの持ち出し、またはラテラルムーブメントを示唆する可能性のある逸脱を特定します。
組織が自律型エージェントをますます多く導入するにつれ、継続的な行動監視はエージェント型AIセキュリティの基盤となる要素となっています。実行時のガードレール、IDガバナンス、最小権限アクセスと組み合わせることで、行動検知により、セキュリティチームは侵害されたエージェントを特定し、不審な活動を調査し、脅威が企業システムに影響を及ぼす前に封じ込めることが可能になります。
エージェント型AIのセキュリティに関するベストプラクティス
セキュリティチームは、エージェント型AIの導入を拡大する前に、これらの基盤となる制御を検証すべきである:
- AIエージェントを独立したガバナンスとライフサイクル管理を備えた第一級のアイデンティティとして扱う
- 最小権限と最小自律性の原則を実装し、必要な権限のみを付与する
- 自律性を拡大する前に監視ツールを導入し、攻撃者の振る舞いパターンを可視化できるようにする
- 不可逆的または影響の大きい行動については、人間の承認を維持する
- AI専用のソフトウェア部品表(SBOM)を作成し、すべてのエージェントコンポーネントを文書化する
- エージェント間通信zero trust 適用し、あらゆる相互作用を検証する
- エージェント固有の攻撃パターンに焦点を当てた脅威ハンティング演習を定期的に実施する
- エージェント監視を既存のSOC自動化ワークフローに統合する
- 引退するエージェントに対する正式な廃止手続きを確立する
自律型AIエージェント、ID、ツール、および機密性の高い企業システムへのアクセスによって生じる新たなリスクに対し、セキュリティチームがどのように対処すべきかをご覧ください。
コンプライアンスと枠組み
組織は、自律型AIのセキュリティ対策が規制要件や業界標準に準拠していることを確認しなければならない。2025年末には、自律型AIシステムに特化した主要なリリースにより、フレームワーク環境が大きく進化した。
規制環境(2026年1月)
表4:自律型AIの規制状況(2026年1月時点)
| 規制 |
発効日 |
主要要件 |
関連性 |
| カリフォルニア州上院法案53号(TFAIA) |
1月1,2026 |
大規模AI開発者向けリスク管理枠組み;15日以内のインシデント報告義務;内部告発者保護 |
高い |
| テキサス・トライガ |
1月1,2026 |
有害なAI出力を禁止(サイバー攻撃の助長を含む);規制サンドボックス |
ミディアム |
| コロラド州人工知能法(SB 24-205) |
6月30、2026 |
高リスクAIシステムの影響評価 |
ミディアム |
| NISTサイバーAIプロファイル |
草案(2025年12月) |
人工知能セキュリティガバナンスのためのCSF 2.0マッピング |
高い |
NISTサイバーAIプロファイル(2025年12月暫定草案)は、AIセキュリティの重点領域を「ガバナンス」「識別」「保護」「検知」「対応」「復旧」を含むサイバーセキュリティフレームワーク2.0の機能にマッピングする。非規制的ながら、この枠組みはAIセキュリティガバナンスの事実上の標準となることが期待されている。
さらにNISTは2026年1月、AIエージェントシステムのセキュリティ上の考慮事項に関する意見を求める情報提供要請(RFI)を発表し、特に実世界のシステムに影響を及ぼすprompt injection、データポイズニング、および目標の不整合といった問題に焦点を当てた。
主要な枠組みの参照:
組織は、特に運用上の具体性を提供するOWASPおよびMITREのガイダンスを含むこれらのフレームワークを組み込むよう、コンプライアンスプログラムを調整すべきである。
主体性を持つAIのセキュリティに対する現代的アプローチ
エージェント型AIセキュリティのベンダー環境は急速に拡大しており、既存プラットフォームと専門スタートアップ双方がソリューションを提供している。組織がエージェントセキュリティの本質がアイデンティティ脅威の検知とレスポンス課題であると認識するにつれ、アイデンティティファーストのアプローチが特に勢いを増している。
主要なエンタープライズベンダー各社、具体的にはPalo Alto NetworksのCortex AgentiX、CrowdStrikeのFalcon Agentic Security、SentinelOneのSingularity AI SIEMが、専用のエージェント型AIセキュリティ機能を投入している。CrowdStrikeによるSGNLの7億4000万ドルでの買収は、特に人間、非人間アイデンティティ、自律型AIエージェントに対するリアルタイムアクセス制御を標的としている。
ブラウザレベルのセキュリティアーキテクチャも制御ポイントとして台頭している。Google Chromeは2025年12月、Geminiエージェント型ブラウジング向けに多層防御アーキテクチャを導入した。その特徴は、ユーザー整合性評価機能(提案された行動を検証する隔離されたAIモデル)、エージェント起源セット(タスク関連サイトへの相互作用制限)、および機微な行動に対する必須のユーザー確認である。
スタートアップエコシステムは多額の投資を集めている。WitnessAIはエージェント型AIガバナンスと可観測性技術で5800万ドルを調達した。Geordieはステルスモードから脱却し、AIエージェントセキュリティプラットフォームで650万ドルを獲得。Prophet Securityはエージェント型SOCプラットフォームで3000万ドルを調達した。
セキュリティ運用にエージェント型AIを導入した組織は、大幅な効率向上を報告している。業界データによれば、エージェント型AIが初期調査と情報補完を担当することでアラート選別時間が60%短縮され、人間のアナリストは複雑な意思決定に集中できるようになった。
Vectra AI 主体性を持つAIセキュリティをどうVectra AI
Vectra AI は、AI エージェントが企業ネットワーク全体に増加すると、潜在的な攻撃ベクトルになるだけでなく、保護を必要とする貴重な資産にもなることを認識し、Attack Signal Intelligence の観点からエージェント AI セキュリティに取り組んでいます。
仮定と妥協の哲学は、エージェントシステムにも自然に適用される。組織は境界制御のみによるエージェントの悪用防止を試みるのではなく、異常なエージェント行動、不正なツール起動、およびID悪用パターンの迅速な検知に注力しなければならない。
これには、AIエージェントの通信、ツール呼び出し、アイデンティティ操作を含む現代的な攻撃対象領域全体にわたる統一された可観測性が求められる。ネットワーク検知とレスポンス能力は、正当な自律操作と攻撃者による操作を区別できるよう進化しなければならない。ITDRソリューションは、非人間的なアイデンティティやエージェント固有の特権乱用パターンまでカバーするように拡張する必要がある。
目標はAIの導入を阻むことではなく、大規模な安全な展開を可能にすることであり、セキュリティチームが自律的な環境で自信を持って運用するために必要な可視性とシグナルの明確さを提供することである。