データポイズニングとは、AIや機械学習モデルが学習や検索に用いるデータを意図的に改ざんし、モデルを攻撃者が望むように動作させることを指します。その標的となるのは、事前学習用コーパス、微調整用データや選好データ、検索インデックス、エージェントツールのコンテキストなどであり、これはデータの窃取ではなく、データの完全性に対する攻撃です。
この脅威はもはや理論上のものにとどまりません。2026年5月、研究者たちはHugging Faceのトレンド1位にランクインしていたモデルリポジトリ内で「malware 」を発見しました。また、2025年の『Nature Medicine』誌に掲載された研究では、トレーニングトークンの0.001%を医療に関する誤情報に置き換えるだけで、医療上の誤りを広めやすくなるモデルが生成されることが示されました。 このページでは、この攻撃を定義し、そのライフサイクルの4つの段階を区分し、MITRE ATLASの「ポイズンネーミング」手法のすべてをその対策と対応付け、セキュリティチームが把握できる問題のどの半分であるかを明確に説明しています。
データポイズニングとは何ですか? 2つの過去の事例が、その境界線を定めています。2026年5月、HiddenLayerの研究者たちは 、情報窃取型マルウェアを実行するローダーを同梱しながら、トレンドランキングの1位に躍り出たHugging Faceのリポジトリについて報告しました。これは「アーティファクトポイズニング」と呼ばれるもので、標的となったのはトレーニングデータセットではなく、公開されたモデルパッケージでした。 トレーニングデータに関しては、2024年に実験が行われた2025年の『Nature Medicine』誌の研究で 、オープンな事前学習コーパスである「The Pile」に対する攻撃がシミュレーションされ、「トレーニングトークンのわずか0.001%を医療に関する誤情報に置き換えるだけで、医療上の誤りを広めやすい有害なモデルが生成される」と報告された。
データポイズニングは敵対的攻撃の一種でしょうか?はい。NIST の敵対的機械学習に関する報告書「NIST AI 100-2e2025 」では、ポイズニングを、推論時の回避攻撃やプライバシー攻撃と並んで、独立した攻撃カテゴリとして分類しています。ポイズニングは、このカテゴリにおける「完全性」に属する攻撃であり、モデルが「知っていること」を盗むのではなく、モデルが「学習したり取得したりするもの」そのものを変更するものです。 モデル反転は、時にデータポイズニングの一種と誤って分類されることがありますが、これはプライバシー攻撃です。OWASPの現行規格LLM05:2026では、 このクラスを次のように広く定義しています。「データおよびモデルポイズニングとは、攻撃者(または安全でないプロセス)がデータやモデルの成果物を操作する一連の攻撃および障害を指す。」
データの改ざんとデータの悪用 データの不正利用とは、組織がすでに保有しているデータを無断で利用することを指します。例えば、従業員が個人的な理由で顧客記録を照会する場合は、これにあたります。データポイズニングとは、モデルが学習したり取得したりするデータを意図的に改ざんすることを指します。例えば、攻撃者がトレーニングセットに誤ってラベル付けされたサンプルを挿入する場合は、これにあたります。両者の真の共通点は、その前提条件にあります。なぜなら、どちらも通常、本来持つべきではない読み取りや書き込みのアクセス権を持つ人物が存在することから始まるからです。
データポイズニング対prompt injection Prompt injection 実行時に、すでに学習済みのモデルに対してモデルの入力を操作するものであり、その効果は通常、セッションが終了すると消滅します。データポイズニングは、モデルが学習した内容や取得する結果を変更するため、データがクリーンアップされるか、モデルが再学習されるまで、その改ざんはすべてのユーザーおよびセッションにわたって持続します。
データポイズニングとモデルポイズニング フェデレーテッドラーニングにおいて、「モデルポイズニング」とは、攻撃者が悪意のあるデータではなく、悪意のあるモデルの更新を送信することを指します。この2つを混同することは、用語の好みの問題ではなく、事実上の誤りです。OWASPの Machine Learning セキュリティ・トップ10 (v0.3 草案、2023年版)は、まさにこの理由からこれらを区別しており、以下のように列挙している。 ML02:2023 データポイズニング攻撃 そして ML10:2023 モデルポイズニング 別個のリスクとして。
データポイズニングとSEOポイズニング SEOポイズニングは 、検索順位を操作してmalware を表示させる攻撃であるのに対し、データポイズニングはAIの学習データや基盤データを改ざんする攻撃である。言葉は共通しているが、攻撃の手口、攻撃対象、防御策はそれぞれ異なる。
中毒が防御手段となる場合 この仕組みは、防御策として逆方向に機能します。2023年のデータに基づいて構築された「Nightshade」の実験では、100件未満の毒入りサンプルでStable Diffusion SDXLのプロンプトを制御できることが示されており、これによりアーティストは自身の作品をスクレイピングから守るために微調整を加えることができます(arXiv:2310.13828 )。 2024年に発表され、2025年に更新されたプレプリントによると、一般的な保護目的の変形ツールは「誤った安心感を与えるだけ」であり、市販の画像アップスケーリング処理によってその効果が低下することが判明した(arXiv:2406.12027 )。 この結果は、スタイルの模倣に対する保護的変形を標的としており、Nightshadeの攻撃的ポイズニングとは異なるメカニズムであるため、Nightshadeの知見を反駁するものではない。
データポイズニング攻撃の種類 ポイズニングの手法は、攻撃者が何を変更、ラベル付け、サンプリング、またはトリガーするか、またその目的が広範囲にわたる機能低下なのか、それとも隠れた動作を引き起こすことなのかという点で異なります。
ラベルのすり替え。 攻撃者は、本来は正当なサンプルのラベルを変更し、悪意のあるものが無害であると、あるいはその逆であるとモデルに学習させる。データ注入。 攻撃者は、モデルが学習に用いるコーパスに、攻撃者が作成した新しいサンプルを挿入する。「クリーンラベル・ポイズニング」。 ラベルを変更することなくサンプルを改ざんし、ラベルの一貫性チェックを無効化する手法である。これは、NIST AI 100-2e2025において名称が定められたサブカテゴリである。バックドアまたはトリガー攻撃。 特定の入力パターンでのみ発動する隠れた挙動を仕込み、それ以外の場合はモデルが通常通り動作するようにする。可用性攻撃または性能低下攻撃。 モデルを特定の点で誤らせるのではなく、全体的に性能を低下させることを目指す。標的型攻撃と非標的型攻撃。 分野横断的な区別:標的型攻撃は特定の結果に変化をもたらすのに対し、非標的型攻撃は全体的なパフォーマンスを低下させる。スプリットビュー・ポイズニング。 データセットのインデックスが依然として参照している期限切れドメインを購入し、その後のクロールで攻撃者のコンテンツが取得されるようにする攻撃手法。2025年5月22日付の同盟機関合同AIデータセキュリティガイダンスで言及されている。フロントランニングによる汚染。 クラウドソーシングされた情報源が収集のためにスナップショットされる直前に、悪意のあるコンテンツを注入すること。これも2025年のガイダンスで言及されている。サブポピュレーション攻撃。 データ分布の一部についてパフォーマンスを低下させつつ、全体的な指標には影響を与えない。「スロードリップ」または「カエルを煮込む」型の中毒。 小さな不正が時間をかけて広まるため、個々の変更だけでは審査の網にかからない。アーティファクト中毒。 MITRE ATLASで以下のように追跡されている、悪意のあるデータセット、モデル、またはエージェントツールをパブリックリポジトリに公開すること AML.0115 そして、以下の機関によって分析され、 クラウド・セキュリティ・アライアンス リポジトリの攻撃対象領域として。この亜種は、 ソフトウェア・サプライチェーン攻撃 、そしてAI特有のケースを除けば、そのページに属しています。中毒が発生する場所:AIデータのライフサイクルの4つの段階 データポイズニングは通常、学習時の問題として捉えられていますが、その見方は現在、2つの段階を見落としています。 AIシステムが依存するデータは4つの異なる段階を経ており、そのそれぞれがポイズニングされる可能性があります。すなわち、事前学習用コーパス、微調整および選好データ、展開されたシステムがクエリ時に読み込む検索インデックス、そしてAIエージェントに供給されるツールの定義、出力、およびメモリです。最初の2つはビルド時の攻撃対象領域です。最後の2つは実行時の攻撃対象領域であり、これらはセキュリティチームが実際に監視できるものです。
段階 攻撃者が変更する内容 制御権の所有者 制御の種類 事前学習 ベースコーパス データエンジニアリングおよびモデルプロバイダー 構築時:プロヴェナンス、サニタイズ、データセットの署名 微調整および嗜好データ タスクコーパスおよび嗜好ペア MLエンジニアリングおよびMLOps 構築時: データセットの系譜、レビュー、アクセス制御RAGおよび検索ライブ検索インデックスまたはドキュメントストアアプリケーションおよびプラットフォームチーム(セキュリティ担当を含む)実行時:書き込みアクセス監視、コーパス変更検知、ガードレールエージェントツールおよびコンテキストツール定義、ツール出力、エージェントメモリプラットフォームおよびセキュリティ実行時:メモリ強化、ツールの許可リスト化、ガードレール
ステージ
攻撃者が変更する内容
支配権は誰にあるのか
制御方式
トレーニング前の準備
基本コーパス
データエンジニアリングとモデルプロバイダー
ビルド時:出所追跡、データサニタイズ、データセットの署名
微調整と設定データ
タスクコーパスと選好ペア
機械学習エンジニアリングとMLOps
ビルド時:データセットのリネージ、レビュー、アクセス制御
RAGと検索
ライブ検索インデックスまたはドキュメントストア
アプリケーションおよびプラットフォームチーム(セキュリティ担当)
実行時:書き込みアクセスの監視、コーパスの変更検出、ガードレール
エージェントツールとコンテキスト
ツールの定義、ツールの出力、エージェントのメモリ
プラットフォームとセキュリティ
実行時:メモリ強化、ツールの許可リスト、ガードレール
表:AIデータライフサイクルの4つの段階、各段階で攻撃者がどのような変更を加えるか、および管理権限を誰が有しているか。
2つの「ポイズニング」段階はビルド時のデータガバナンス対象領域であり、残りの2つはセキュリティチームが監視できる実行時の対象領域です。
検索強化生成(RAG)は、日々変化するドキュメントストアに基づいてモデルの回答を生成するため、ポイズニングは独自のMITRE ATLAS手法を用いた実行時攻撃となります。 AML.0070 RAG中毒。参考となる研究成果は、2024年から2025年にかけて実施された実験結果としてUSENIX Security 2025で発表された「PoisonedRAG」であり、この研究では、数百万件のテキストからなる知識データベースに「対象となる質問ごとに5つの悪意のあるテキストを注入した場合、攻撃の成功率が90%に達した」と報告され、評価対象となった防御策は不十分であることが判明した(arXiv:2402.07867 ).
ファインチューニングには、新たな課題として「選好データ」があります。ダイレクト・プリファレンス・オプティマイゼーション(DPO)などのアラインメント手法は、「良い」または「悪い」とランク付けされた応答のペアから学習するため、破損した選好ペアは選好シグナルそのものを歪め、ファインチューニングされたモデルが「良い回答」とみなすものを誤った方向に導いてしまいます。このステージには、他のファインチューニング用コーパスと同様に、構築時の制御機能(リネージ、レビュー、アクセス制御)が引き継がれています。
最新のサーフェスは「エージェントコンテキスト」です。 AIエージェントのセキュリティ確保 これはそれ自体がひとつの分野ですが、中毒攻撃に特有の点は、エージェントが読み込むあらゆるものが攻撃者のコンテンツを含まれている可能性があるということです。ある技術が公開されたのは DEF CON 34 2026年8月、攻撃者はログフィールドにテキストを埋め込み、その後、AIトリアージエージェントがこれを読み取って対応を行う(セキュリティ・ウィーク (2026年8月10日);あるコーディングエージェントに対する研究者ら自身の報告による成功率は90%であった(テネット・セキュリティ ). いずれの開示資料もフレームワークの名前を明記していないが、この手法は明確に AML.0080 AIエージェントのコンテキストポイズニング。全体を通じて 生成AIのセキュリティ 、どの段階においても、結局は次の2つの質問に帰着します。それは、「誰がデータに書き込みができるのか」と、「誰がその書き込みを監視しているのか」です。
攻撃者が書き込み権限を取得する方法 あらゆるポイズニングの手法には、共通する前提条件が1つあります。それは、内部トレーニングセット、微調整用コーパス、検索インデックス、またはモデルレジストリにポイズニングが行われる前に、誰かがまずそれらへの書き込み権限を取得していたということです。つまり、認証情報の漏洩、権限が過剰に付与されたサービスアカウント、クラウド利用権限の悪用、あるいは内部関係者による行為が背景にあるということです。MITRE ATLASの用語で言えば、ポイズニング行為は以下の下流に位置します。 AML.0004 初期アクセス、 AML.0013 認証情報のアクセス、 AML.0008 ディスカバリー、 AML.0015 横方向の移動、および AML.0009 収集。毒そのものに関する情報は一切通信回線を通らないが、それを仕掛ける侵入行為に関するあらゆる情報は、SOCがすでに収集しているテレメトリデータとして送信される: アイデンティティ脅威検知 認証フェーズでは、 クラウドの検知と対応 権利付与段階において。
「ポイズニング」という行為は、通常の侵入チェーンにおける最後のリンクであり、上流のすべてのリンクからは標準的なセキュリティテレメトリが送信されます。
MITRE ATLASは、すでにどの程度の書き込みアクセス権が公開されているかを記録しています。事例研究 AML.CS0028, 実際のインシデントではなく演習として記録され、2023年9月26日付の報告書によると、「インターネット上に公開された設定ミスのあるプライベートコンテナレジストリが8,000件以上」あり、そのうち約70%が書き込みアクセスを許可しており、その中に1,000件以上の固有のAIモデルがアクセス可能な状態にあることが報告されている(MITRE ATLAS データリポジトリ ). 書き込み可能なレジストリは攻撃の標的となります。そこにデータを書き込める者なら誰でも、モデルを置き換えてしまうことができるからです。
2026年7月に発生したHugging Faceのセキュリティインシデントは、この問題のインバウンド版を示すものである。 同社の開示報告書によると、「悪意のあるデータセットが、当社のデータセット処理における2つのコード実行パスを悪用し」、処理ワーカー上でコードを実行したとのことです(Hugging Face開示報告書、2026年7月16日; 技術的タイムライン )。これは、トレーニングデータの汚染ではなく、データセットのアーティファクトに起因するコード実行であり、データセットの取り込みが実行境界であることを示す最も明確な論拠です。プラットフォーム側はこれに対応し、両方のコード実行パスを遮断しました。 2026年8月17日に投稿された、組織的な検索結果改ざんに関するプレプリント(arXiv:2608.16044 )も、同じ前提から始まっている。すなわち、共有ストレージに文書を追加できる者なら誰でも、その回答を操作しようと試みることができるというものである。
書き込みアクセスパスを検知対象領域とみなす。無許可のAI利用は 、誰も登録していないデータストアを生成することでこの領域を拡大させ、データ漏洩 につながるようなアクセス失敗は、AIパイプラインにおいては、汚染されたアーティファクトの生成につながる。
MITRE ATLASにおけるデータポイズニング:手法と対策 MITRE ATLASは、ATT&CK に対応する敵対的AIのフレームワークであり、ここでポイズニングの調査結果が脅威モデルへと昇華されます。この対応表はATLAS v2026.07(データファイルの日付:2026年7月31日、GitHubリリース公開日:8月7日。1つのリリースに対して2つの日付が記載されていますが、矛盾ではありません)に基づいています。 このリリースには、1つのマトリックス、16の戦術、101の手法、77のサブ手法、37の緩和策、および68のケーススタディが含まれています(リリース記録 )。 ATLASはおよそ毎月リリースされており、v2026.05は5月27日、v2026.06は6月30日、v2026.07はデータ日付が7月31日となっています。そのため、数値を引用する際は、現在のリリースを確認してください。
「毒」の名を冠した8つの技法がマトリックス全体に広がっており、v2026.07ではそれぞれに「実現済み」「実証済み」「実現可能」という成熟度値が割り当てられており、これが組み込みの優先順位付けの指針として機能しています。
ID
名前 (v2026.07)
戦術
満期
AML.0020
トレーニングデータのポイズニング
AML.0006 永続性
実現した
AML.0115
改ざんされたAIアーティファクトを公開する
AML.0003 資源開発
実現した
AML.0115.000
データセット
AML.0003 資源開発
実証済み
AML.0115.001
モデル
AML.0003 資源開発
実現した
AML.0115.002
AIエージェントツール
AML.0003 資源開発
実現した
AML.0018.000
Poison AIモデル
AML.0001 AI攻撃の準備段階と AML.0006 永続性
実証済み
AML.0070
RAG中毒
AML.0006 永続性
実証済み
AML.0080
AIエージェントのコンテキスト汚染
AML.0006 永続性
実証済み
AML.0099
AIエージェントツールのデータポイズニング
AML.0006 永続性
実現可能
AML.0110
AIエージェントのツールポイズニング
AML.0006 永続性
実現した
AML.0011.002
「Poisoned AI Agent」ツール
AML.0005 実行
実現した
表:MITRE ATLAS v2026.07 に含まれる 11 の「poison」関連のオブジェクト。これには、8 つの異なる「poison」と名付けられた手法に加え、以下の 3 つのサブ手法が含まれる。 AML.0115.
技術IDは最近変更されたため、2026年8月より前に公開された参考文献には、廃止された識別子が記載されている可能性があります。2026年7月31日、ATLASは3つの廃止された技術を統合し、 AML.0019 汚染されたデータセットを公開する、 AML.0058 「Poisoned Models」を公開し、 AML.0104 「Poisoned AI Agent」ツールを公開し、 AML.0115 「改ざんされたAIアーティファクト」を公開する。これには、データセット、モデル、AIエージェントツールに関するサブテクニックが含まれる。従来のトレーニングセット改ざんにおける現在の親テクニックは、 AML.0020 「トレーニングデータのポイズニング」の項では、 AML.0006 粘り強さ。
多くの解説が触れていない点として、緩和策との関連付けが挙げられます。ATLASでは37の緩和策が挙げられており、8つの「ポイズン」と名付けられた手法のうち6つには、少なくとも1つの対応する制御策が割り当てられています(MITRE ATLASデータリポジトリ ):
テクニック
ATLASの緩和策のマッピング
AML.0020 トレーニングデータのポイズニング
AML.M0001 モデルアーティファクトの公開を制限する、 AML.M0005 AIモデルおよび保存中のデータへのアクセスを制御し、 AML.M0007 トレーニングデータのサニタイズ、 AML.M0008 AIモデルの検証、 AML.M0023 AI部品表、 AML.M0025 AIデータセットの来歴を管理し、 AML.M0035 AIレッドチーム
AML.0115 改ざんされたAIアーティファクトを公開する
AML.M0007, AML.M0008, AML.M0016 脆弱性スキャン(データセット:.000 → M0007;モデル:.001 → M0008 および M0016;AIエージェントツール:.002 → M0016)
AML.0018.000 Poison AIモデル
AML.M0005, AML.M0007, AML.M0008, AML.M0013 コード署名、 AML.M0025, AML.M0035
AML.0070 RAG中毒
AML.M0020 生成AIのガードレール、 AML.M0035 AIレッドチーム
AML.0080 AIエージェントのコンテキスト汚染
AML.M0031 メモリ強化、 AML.M0035 AIレッドチーム
AML.0099 AIエージェントツールのデータポイズニング
AML.M0020 生成AIのガードレール
AML.0110 AIエージェントのツールポイズニング
マッピングされていないもの
AML.0011.002 「Poisoned AI Agent」ツール
マッピングされていないもの
表:v2026.07におけるポイズニングに対するATLASの手法と対策の対応表。なお、2つのエージェント・ツール手法については、対応する対策が設定されていない。
2行が空欄となっていますが、これは批判というよりはむしろ発見と言えます。v2026.07の時点で、ATLASは AML.0110 AIエージェントのツールポイズニング、あるいは AML.0011.002 「Poisoned AI Agent Tool(AIエージェントへの悪意ある操作)」。このフレームワークの制御範囲は、最新のエージェント・ツール技術にまだ追いついていない。上記の技術レベルの視点は、標準化団体が公表している内容よりも具体的である。というのも、OWASP独自の2026年版フレームワーク・マッピング付録では、このリスクをATLASと戦術レベルでのみ関連付けており、技術IDは記載されていないためである(付録A ).
2つの表をファイル管理システムとして活用してください。ポイズニングの発見結果は8つの手法IDのいずれかに分類され、提案された対策は「緩和策」の列に対応付けられ、監査人のカバー率に関する質問は行ごとのギャップ分析となります。このページでは、ポイズニングの対応表の説明にとどめています。ATLASフレームワーク自体 (完全な戦術構造を含む)については 、別のページで解説しています。
研究や一連の出来事が実際に示していること 測定結果は、ある一つのテーマに集約されます。それは、効果サイズはコーパスのごくわずかな割合に過ぎず、どの数値にも、その証明内容を変える範囲の限定条件が付随しているということです。以下の年表では、出版年とデータ収集期間を別々に記載しています。これは、この2つが数年単位で異なることが多いためです。
発見
公開日
データ期間
ソース
Gmailのスパム分類システムを不正に操作しようとする大規模な試みが、少なくとも4件あった(過去の実例)
2021
2017年11月から2018年初頭
CSOオンライン
50,000枚の学習画像のうち50枚(0.1%)を改変するだけで、モデルをポイズニングするのに十分だった
2021
2021
USENIX Security 2021 、2026年のSEIブログで 引用された
LAION-400M または COYO-700M のデータセットの 0.01% が、60ドルでポイズニングされていた可能性がある
2023
2022
arXiv:2302.10149
トレーニングトークンの0.001%を置き換えたところ、ベースラインと比較して有害な医学的転帰が増加した
2025
2024
『Nature Medicine』の全文
対象の質問ごとに5つの悪意のあるテキストを使用した場合、RAGに対する攻撃の成功率は90%であった
2025年(USENIX Security)
2024年から2025年
PoisonedRAG
250件のポイズンドドキュメントにより、パラメータ数が6億から130億のモデルが侵害された
2025
2025
arXiv:2510.07192 (アンソロピック原理に関する注意点 あり)
話題のHugging Faceリポジトリが、そのローダーを通じて情報窃取型マルウェアを配布していた
2026
2026年4月24日から5月7日まで
HiddenLayer
Hugging Face上に存在する、影響の大きいペイロードを伴う969の悪意のあるAIエージェントスキルに加え、495の悪意のあるモデルおよび56の悪意のあるOpenVSX拡張機能
2026
2025
JFrogレポートの発表
表:確認済みの中毒に関する研究および事案(古いものから新しい順)。各行ごとに、発表年とデータ収集期間が別々に記載されている。
2024年の実験結果に基づき2025年に発表された『Nature Medicine』の論文からは3つの図が流布しているが、これらは1つの矛盾ではなく、3つの異なる実験結果である。 0.01%のポイズニング率において、13億パラメータのモデルはベースラインと比較して11.2%多くの有害な補完結果を生成した(P = 0.00047)。また、0.001%のポイズニング率では、その増加率は7.2%であった(P = 0.01463)。 3つ目の図は、より大規模なモデルに関するものである。40億パラメータのモデルを対象とした場合、同じ0.001%の率での単一概念によるワクチン誤情報攻撃により、4.8%の増加が見られた(P = 0.03836)(全文 )。 これら3つはいずれも、ベースラインに対する有害な完成結果の増加であり、絶対的な誤り率ではない。これらを「誤答率」として記述することは、指標の誤った解釈にあたる。この同じ研究は、以下の検出セクションの根拠となっている。なぜなら、その汚染されたモデルは、標準的なベンチマークにおいてクリーンなモデルと同等の性能を示したからである。
2025年のプレプリントで報告された「250件の汚染文書が、あらゆるモデルサイズおよびデータセットサイズにおいて同様にモデルを損なう」という知見は、6億から130億パラメータにわたる事前学習の実行全体を通じて、定数個の汚染文書で同様の結果が得られたものである(arXiv:2510.07192 )。 著者らはこの数値について次のような注意書きを添えている。「本研究は、(意味不明なテキストを生成する)限定的なバックドアに焦点を当てており、最先端のモデルにおいて重大なリスクをもたらす可能性は低い」(Anthropic )。2026年8月20日現在、このプレプリントは改訂されておらず、査読付き学術誌への掲載も、再現研究の報告も確認されていない。
2026年の代表的なインシデントは、トレーニングデータポイズニングではなくアーティファクトポイズニングであり、これは通常のmalware として発動した。HiddenLayerは、あるリポジトリが「Hugging Faceでトレンド1位となり、18時間足らずで約24万4千回のダウンロードと667件のいいねを獲得した」と報告しており、同レポートの別の箇所では「削除されるまでに20万回以上のダウンロードがあった」と記されている。 そのローダーはPowerShellを取得し、Windows上のブラウザの認証情報、ウォレット、Discordを標的とした1.07 MBのRustベースの情報窃取型マルウェア を実行した(HiddenLayer、2026年5月7日 )。 リポジトリ規模での測定結果も同様の傾向を示している。2025年のデータを網羅した2026年5月20日のレポートにおいて、JFrogは、Hugging Face上の495の悪意のあるAIモデルおよびOpenVSX上の56の悪意のある拡張機能に加え、影響の大きいペイロードを運ぶ969の悪意のあるAIエージェントスキルを特定した(JFrogの発表 )。
誰も測定していないのが発生率だ。本ページのための調査では、WEFおよびアクセンチュアの『Global Cybersecurity Outlook 2026』(64ページにわたる報告書全体で「poison」という言葉は一度も登場しない)、SANSの『2026 AI Survey』、スタンフォード大学HAIの『2026 AI Index』、あるいはガートナー、フォレスター、IDCが公表した調査研究のいずれにおいても、データポイズニングの発生率に関する数値は見つからなかった。 こうした情報の空白があるからこそ、その代わりに日付の明記されていないベンダー側の数値が流布しているのだ。2026年7月のプラットフォーム侵入事件における対応状況については、Hugging Faceのエージェント侵害に関する当社の分析を 参照のこと。
データポイズニングの検知と防止 まずは2つの率直な答えから始めましょう。トレーニング後にポイズニングを検出することはできるでしょうか? 信頼性は低いと言えます。オフラインの手法は存在しますが、ベンチマークでの同等性は何も証明していません。というのも、『Nature Medicine』の論文で取り上げられたポイズニングされたモデルは、標準的なベンチマークにおいてクリーンなモデルと同等の成績を示していたからです。 再学習によって除去できるか? 信頼性はない。バックドア挙動は、教師あり微調整、強化学習、敵対的学習を経ても残存しており、敵対的学習によってモデルはトリガーをより正確に認識するようになり、事実上その挙動を隠蔽してしまっている(arXiv:2401.05566 , 2024)。 「機械学習のアンラーニングに関する実用的な解決策は、まだ数年先である」という2021年の実務者による評価が、依然として有効な見解であり、現時点での実用的な解決策は、検証済みのクリーンなデータを用いたコストのかかる再学習である(CSO Online, 2021 )。
その研究で成果を上げたのは、出力層のスクリーニングだった。「生物医学知識グラフを用いて医療用LLMの出力をスクリーニングすることで、有害コンテンツの91.9%を捕捉する危害軽減戦略を提案する」もので、F1スコアは85.7%であった(2025年発表、2024年のデータ)(マウント・サイナイの記録 )。
「オフライン」と「ランタイム」という2つの状態が明確に区別されており、それぞれに名前付きの所有者が割り当てられています。
ディメンション
オフライン(ビルド時)
実行時間
テクニック
影響関数、活性化クラスタリング、保留カナリア、1つ除外法、データセットのサニタイズ
データストアにおける書き込みアクセスの異常検知、検索コーパスの変更監視、プル時のモデル・アーティファクトの来歴検証、ダウンロードされたアーティファクトの実行後の挙動
ATLASの緩和策
AML.M0007, AML.M0008, AML.M0023, AML.M0025, AML.M0013, AML.M0001, AML.M0005
AML.M0020, AML.M0031, AML.M0016, AML.M0035
所有者
データエンジニアリング、MLエンジニアリング、MLOps
セキュリティ運用、プラットフォーム
表:手法、対応するATLASの対策、および担当チーム別に分類したオフラインおよび実行時のポイズニング検出。
AIセキュリティ態勢の管理 ビルド時のインベントリおよび構成レイヤーを管理しており、 AIによる脅威検知 実行時の動作レイヤー、および AIシステムに対するレッドチームング 具体化する AML.M0035 AIレッドチーム。
モデルファイル形式は、ポイズニングと従来型のコード実行が交わる領域です。ATLASによる対策 AML.M0016 「脆弱性スキャン」では、次のように明言している。「AIモデルの保存に一般的に使用されるpickleファイルなどのファイル形式には、任意のコード実行を可能にするエクスプロイトが含まれている可能性がある」(MITRE ATLAS データリポジトリ ). 通貨に関する詳細として、2025年1月29日にリリースされたPyTorch 2.6.0以降、 torch.load デフォルトでは weights_only=True、この変更について、リリースノートでは「重要なセキュリティ改善策」と説明されている(PyTorch 2.6.0 リリースノート ). Safetensorsは、第三者機関による監査を受けており、 2023 , は依然としてより安全なシリアライズ方法であり、Hugging Face ではその方法について解説されています。 ピクルスのスキャン 捕まえられるものと、捕まえられないもの。
スキャン層そのものは不完全なソフトウェアである。2026年8月20日にNVDでキーワード検索を行ったところ、オープンソースの悪意のあるモデルファイルスキャナである「picklescan」に関連するCVEが59件ヒットし、研究者たちは zero-day の3つの脆弱性 その中では。対照的に、トレーニングコーパスの破損については、出荷済みのソフトウェアバージョンにおける脆弱性ではないため、CVEへの登録はほぼ皆無である。NVDは、MLサプライチェーンを代わりに「デシリアライゼーションおよびメモリ安全性の問題」として索引付けしており、ある主要なフレームワークに対するCPEクエリでは結果が0件であるのに対し、キーワード検索では70件がヒットするため、CPEベースのスキャナーはこのレイヤーを過小報告している。スタックの悪用される側は、規制当局によって追跡されている。 2026年8月25日現在、CISAの 既知の悪用されている脆弱性のカタログ (カタログバージョン 2026.08.24、1,675 エントリ)には、MLflow のエントリを含む 10 件の ML-stack エントリが収録されていました。 CVE-2026-64849 (サーバーサイドのリクエスト偽造 (2026年8月19日追加、是正期限:9月2日)およびレイの CVE-2025-62593 (コードインジェクション、8月17日追加、8月20日締切)、CNAによるCVSS v4.0評価では「9.4(重大)」、NVDによるCVSS v3.1評価では「8.8(高)」と評価された。
検索システムに関しては、2つの独立した研究結果が、取り込み時刻によるフィルタリングは解決策ではないという点で一致している。 PoisonedRAGは、評価した防御策が不十分であると結論付け、2026年8月17日のプレプリント(arXiv:2608.16044 )では、最も強力に訓練された分類器であっても、協調的なポイズニングと正常なトラフィックを偶然の確率と同程度にしか区別できず、偽陽性率1%の条件下で攻撃のわずか4.2%しか検知できなかったのに対し、リクエストを監視する検索時検出器は同じ偽陽性率で100%を検知したと報告されている。 検索型防御は、実行時の領域に位置づけられる。
規格や規制におけるデータ改ざん OWASPの現在の識別子は LLM05:2026 データおよびモデルのポイズニング、同プロジェクトによると、2026年8月4日に公開された 正規のリポジトリ 、そして2026年の文章ではその枠組みがさらに広げられており、「現代のGenAI環境において、ポイズニングは従来の意味での『訓練データ』に限定されない」と述べられている(LLM05:2026 ソース )。順位は版ごとに変動しており、2023/24年の LLM03 トレーニングデータのポイズニング 廃止されたため、2025年のリストでは名称と番号が変更された LLM04:2025 データおよびモデルのポイズニング、そして2026年にそれを 05:2026、過剰な介入とサプライチェーンが 03:2026 そして 04:2026 (リリースに関する報道 ).
EU AI法は、この攻撃を基本法の中で、かつまさに1回だけ言及している。「データポイズニング」という語句は、統合法の第15条(5)項において、1回のみ登場する。 同規定は、高リスクAIシステムに対し、「訓練データセットを操作しようとする攻撃(データポイズニング)を防止、検知、対応、解決、および制御するための」技術的措置を義務付けており、同条項は事前学習済みコンポーネントのモデルポイズニングにも適用される(EUR-Lex統合テキスト )。 この義務は予防のみに限定されるものではなく、検知と対応も明示された義務となっている。施行時期については、第113条の改正後、第15条を含む第III章の要件は、第6条第2項および附属書IIIに該当する高リスクシステムに対しては2027年12月2日から、第6条第1項および附属書Iに該当する高リスクシステムに対しては2028年8月2日から適用される。 第15条第5項は、すでに施行されている拘束力のある法律であるが、高リスクシステムにはまだ適用されていない。一方、第50条の透明性義務など、同法の他の部分は、予定通り2026年8月2日に発効した。
汎用モデルについては、その枠組みが異なります。同法の第55条に定めるシステミック・リスクに関する義務の遵守手段である「GPAI実践規範(最終版、2025年7月10日)」の「安全性およびセキュリティ」の章にある措置3.1(実践規範 )では、「トレーニングデータのレビュー(例:データポイズニングや改ざんの兆候の有無の確認)」が明記されています。 2025年3月24日に公表され、4月1日に正誤表で修正されたPDFがアップロードされた「NIST AI 100-2e2025」は、依然として公式の分類体系であり、クリーンラベルポイズニングをそのサブカテゴリとして定義している。 ENISAの『Threat Landscape 2025』(v1.2、2025年10月1日公開、2024年7月1日から2025年6月30日までの4,875件のインシデントを網羅)は、拡散ベクトルの一つとして「AIサプライチェーンを標的とした、ポイズニングされたホスト型機械学習(ML)モデル」を指摘している(ENISA Threat Landscape 2025 )。 2025年5月22日に発表された同盟機関合同の「AIデータセキュリティガイダンス」では、10のライフサイクルにおけるベストプラクティスが追加されており、この文書において「スプリットビュー」および「フロントランニング」ポイズニングが初めて言及されている。
フレームワーク
識別子
マッピングの仕組み
証拠
OWASP GenAI LLM トップ10(2026年)
05:2026 データおよびモデルの汚染
データおよびモデルポイズニングに関する現在の指定リスククラス
ソースリポジトリ
OWASP「Machine Learning 」セキュリティ・トップ10
ML02:2023 データポイズニング攻撃(v0.3 草案、2023年版)
データポイズニングを以下から区別する ML10:2023 モデルポイズニング
プロジェクト文書
EU人工知能法
EU規則(2024/1689)第15条第5項
「データポイズニング」と命名。2027年12月2日および2028年8月2日より、高リスクシステムに適用される。
EUR-Lex
GPAI行動規範
「安全・保安」の章、措置3.1
汎用モデルにおける中毒の兆候に関するトレーニングデータの検証
code-of-practice.ai
NIST
AI 100-2e2025(2025年3月24日)
「中毒」を独立した攻撃カテゴリとして定義;クリーンラベル中毒の定義
NIST コンピュータ科学・情報研究センター
MITRE ATLAS
AML.0020 さらに、毒の名を冠した七つの技
上記のセクションで整理された、対策と緩和策の対応表
データリポジトリ
提携機関によるガイダンス
AIデータのセキュリティに関するベストプラクティス(2025年5月22日)
10のライフサイクル・プラクティス。「スプリットビュー」と「フロントランニング・ポイズニング」と呼ばれるもの
氏名が引用されているが、調査の結果、公開されているURLは確認されなかった
ENISA
「脅威の全体像 2025」(2025年10月1日)
AIサプライチェーンにおいて、改ざんされた文書がホスト型モデルに影響を与えた
ENISA PDF
表:現行の規格および規制においてデータポイズニングが言及されている箇所、およびそれぞれの適用識別子と日付。
これらの義務を、管理対象のシステムと照らし合わせて追跡することが、AIガバナンスツールの 役割です。
データポイズニングに対する現代的なアプローチ 業界の進む方向性は「プロヴェナンス」にあります。つまり、データセットやモデルを、その出所、管理状況、完全性が「前提」として扱われるのではなく、追跡・検証される「成果物」として扱うことです。OWASPの2026年版リスクガイダンスでは、CycloneDXなどのSBOMおよびML-BOM形式を用いてデータセットとモデルの系譜を追跡し、署名と検証を徹底するとともに、ライフサイクルの各段階を通じてデータの完全性を継続的に検証することが求められています。
こうした仕組みは次々と登場しています。2025年4月4日に公開された「OpenSSF Model Signing v1.0 」は、モデルアーティファクトに対する暗号署名規格を定めています。 また、Coalition for Secure AIとOASISは 2025年6月12日に『AIサプライチェーンのリスクと管理策の確立、V 1.0』を公表し、その3.1.1節は「データポイズニング:AIサプライチェーンにおける脅威と緩和策」となっている。 2026年5月12日に発表されたG7のAI向けSBOMガイダンスでは、データセットの来歴が最低限必要な要素として挙げられています。また、C2PAのAIおよび機械学習に関するガイダンス (これは、正式に策定されたML来歴標準というよりは、参考となるアプリケーションパターンです)では、第2節のタイトルを「データポイズニング攻撃」としています。
ここで率直な注意点があります。OpenSSFのモデル署名に関する発表記事では、データポイズニングについては一切言及されていません。モデル署名は、トレーニング後にアーティファクトが改ざんされていないことを証明するものです。これはアーティファクトの完全性を確保するための制御であり、トレーニングデータのポイズニングを防ぐための制御ではありません。また、データセットの署名については、明示的に今後の課題として挙げられています。 ポイズニングされたモデルに署名を行っても、ポイズニングされたモデルに対して有効な署名が生成されるだけです。プロヴェナンスは、特定の当事者やパイプラインに対してのみ信頼を限定するものであり、それらの当事者が何を用いて学習を行ったかを検証するものではありません。これらの制御措置をAIセキュリティプログラムに 組み込む際には、この点が極めて重要です。
Vectra AIがデータポイズニングをどのように捉えているか 率直に言えば、トレーニング時のデータ整合性は、検知の問題ではなく、データガバナンスおよびMLOpsの問題です。ネットワーク上で改ざんされた重みを検知できるセキュリティ製品は存在せず、いくらネットワークメタデータを分析しても、精選されたデータセット内のラベルが入れ替わっていることは判明しません。 Vectra AIの「Attack Signal Intelligence 」のような検知手法が適用されるのは、他の侵入攻撃と同様に振る舞う攻撃の一部です。つまり、攻撃者にトレーニングデータや基幹データへの書き込みアクセス権を与える、ID、認証情報、およびクラウド利用権限に関する活動を検知することです。それは、稼働中のデータ取得やエージェントツールのインターフェースに対する実行時の操作を検知することを意味し、これは AML.0070。また、これは、改ざんされたアーティファクトが実行された際の侵害後の挙動を検知することを意味します。2026年の代表的な事例では、これは汎用的な情報窃取型マルウェアを指していました。 指揮統制 そして、認証情報の盗難。その毒は目に見えない。しかし、それを仕込む侵入行為は目に見える。