NVIDIA主導「Open Secure AI Alliance」発足!AIエージェントの長期記憶・メモリポイズニングを防ぐ企業防衛策
- 8月27日
- 読了時間: 14分
更新日:8月31日

生成AIの活用領域は、指示に応答するだけの「チャット型AI」から、人間の代わりに自律的にタスクを判断・実行する「AIエージェント(Agentic AI・自律型AI)」の本格導入期へとシフトしています。しかし、その利便性の裏で、エージェント特有の高度なサイバー脅威が急増しています。
2026年7月、NVIDIA主導のもと、Microsoft、IBM、Hugging Faceなどの37社超のクラウド・AI・セキュリティ企業および研究機関が結束し、業界連合「Open Secure AI Alliance(OSAA)」を発足させました。(その後、約1週間で120社超に拡大)OSAAはオープンウェイトモデルとオープンソースツールを活用したAIセキュリティ標準の策定と、実践的な防衛ツールの普及を目的としています。(参考:1,2,3)
本記事では、OSAAの発足背景から、AIエージェントの「長期記憶」を狙う「メモリポイズニング」や「間接プロンプトインジェクション」の脅威を解き明かし、AIエージェントを脅かす最新脆弱性と、企業が今すぐ講じるべき実践的防衛策を徹底解説します。

INDEX


「Open Secure AI Alliance(OSAA)」発足の背景:なぜ37社超が今結束したのか

従来のクローズドなAIガードレールだけでは、最新のAI攻撃に対応できないという限界が露呈し、NVIDIAやMicrosoftなど37社超がオープンな標準と共有ツールで防衛するためにOpen Secure AI Allianceを設立しました。
▶︎「クローズドAIのガードレール」がサイバー防御を阻んだ限界

OSAAの問題提起によれば、従来の「クローズドなAIガードレール」は内部構造がブラックボックス化しているため客観的な検証が難しく、語彙の迂回や「ジェイルブレイク(Jailbreak)」による悪用リスクが指摘されています。
自然言語を解釈するAIの特性を突いた防衛線の突破は、外部APIやデータベースと連携するAIエージェント時代において、業務への深刻な影響に直結します。
さらに深刻なのが、以下のような「情報の非対称性」です。
●攻撃者
API経由で何千回も試行し、回避パターンを効率的に学習できる
●防御者
内部ロジックを見られずベンダー頼みになるため、対応や分析が遅れる
この攻撃者優位の環境を打破するため、モデル内部を直接検査・改良でき、防衛側も対等な分析力を持てる「オープン防衛」への移行が急務となっています。

▶︎Hugging Faceのインシデント:オープンウェイトモデルだけが脅威を解析できた理由

この限界を決定づけたのが、大手プラットフォーム「Hugging Face」で発生したセキュリティインシデントです。
不正アクセス発生時、商用クローズドモデルはガードレールが裏目に出て攻撃ログ(17,000件超)の解析リクエスト自体を遮断し、調査を阻害しました。一方、自社インフラで動作するオープンウェイトモデル「GLM 5.2」を活用したことで、数日要するフォレンジック分析をわずか数時間で完遂できたのです。
この事件は、「AIのセキュリティは、オープンに開かれ誰でも検証できる状態でなければ担保できない」という強力な教訓を業界に刻み込みました。同社が先立って進めていた安全なモデル保存形式「Safetensors」のPyTorch Foundationへの移管(2026年4月)も、こうしたインシデントを経て、オープン防衛エコシステムの先行例として改めて注目を集めることとなりました。(参考:4,5,6)
▶︎NVIDIA、Microsoft、IBMなど37社超が結束した理由

「セキュリティツールや防御基盤自体がオープンかつ透明でなければ、AIエージェントの脅威には立ち向かえない」この教訓から、NVIDIA、Microsoft、IBM、CrowdStrike、Palo Alto Networksをはじめとする37以上の企業・団体が結集。オープンな防衛ツールの共同開発と共通基準の策定を目指し、「Open Secure AI Alliance(OSAA)」が誕生しました。 OSAAの主たる目的は以下の3点に集約されます。
1:オープンなAIセキュリティ標準の策定
モデル・インフラ・アプリケーション・データの各レイヤーにおける共通の脆弱性評価基準を設ける。
2:防衛ツールおよびアプローチの共有
各社が開発したセキュリティ評価用フレームワークや、モデルのデータスキャンツールをオープンソースで持ち寄る。
3:脆弱性データベースの構築
AI特有のハッキング手法(プロンプトインジェクション、データ汚染など)の情報を迅速に共有する。
この結束により、企業はベンダーロックインを避けつつ、国際標準に基づく最新のAIセキュリティの恩恵を受けることが可能になります。(参考:3)

企業を脅かす「AIエージェント」特有の3大脆弱性

AIエージェントは自律性と実行権限(API連携)を持つため、従来のチャット型AIとは異なり、騙された際の行動が直接物理的な実害(不正送金やデータ漏えいなど)に直結する3つの致命的な脆弱性を抱えています。
▶︎外部データやAPI連携の隙を狙う「間接プロンプトインジェクション」

「プロンプトインジェクション」とは、AIへの入力に悪意ある指示を紛れ込ませて安全制限を突破するサイバー攻撃ですが、AIエージェントにおいて最も警戒すべきなのが「間接プロンプトインジェクション(Indirect Prompt Injection)」です。
これは、社内データベースや外部Webサイトを参照するAIエージェントに対し、データ内に悪意ある命令(プロンプト)を潜ませて動作を乗っ取る攻撃です。エージェントが連携先データを読み込んだ瞬間、ユーザーの意図しない処理が裏で実行される危険性があります。(参考:18)
▶︎意思決定を乗っ取る「メモリポイズニング(AIエージェントの長期記憶改ざん)」と暴走

AIエージェントの最大の特徴は、過去の会話履歴やユーザーの好みを長期間保持する「長期記憶(Long-Term Memory)」機能です。
この長期記憶に悪意あるデータを植え付け、将来の意思決定を恒久的に歪める攻撃を「メモリポイズニング(Memory Poisoning)」と呼びます。誤った記憶を注入されたAIエージェントは、人間の介入なしに不適切なAPIを実行したり、権限外のデータベース操作を行ったりと、深刻なシステム暴走を引き起こします。
メモリポイズニングの真の恐ろしさは、汚染が検知されないまま静かに潜伏・蓄積される点にあります。「特定製品を優先させる」「特定ユーザーの権限を昇格する」といった偽情報を徐々に記憶させることで、組織全体の意思決定を裏から静かに歪めることが可能です。(参考:19)
▶︎複数エージェント間で被害が拡大する「マルチエージェント連鎖障害」

企業で使われるAIシステムでは、複数のAIエージェントが協調して業務を処理する「マルチエージェント」が主流になっています。この仕組みは効率性を高める一方、一つのエージェントが侵害されると連鎖的に他のエージェントへ被害が波及するリスクを生みます。
たとえば、顧客対応エージェントが間接プロンプトインジェクションによって乗っ取られた場合、そのエージェントは社内の「データベース検索エージェント」や「メール送信エージェント」に対して、正規の指示を装って不正な要求を送信します。エージェント間の通信プロトコル(規約)において相互認証や最小権限の原則が徹底されていない場合、他のエージェントは「仲間からの指示だから安全だ」と暗黙の信頼を置いて処理を実行してしまい、被害が一瞬にして全社規模のシステムへ拡大する「連鎖障害(Cascading Failure)」を引き起こします。(参考:19,20)


NVIDIAらが提供する、AIエージェント向けオープンAIセキュリティツール群とは

OSAAの枠組みのもと、NVIDIA、Microsoft、IBM、Hugging Faceなどの加盟各社は、AIエージェントの安全性評価、脆弱性スキャン、セーフティモデルの移管など、実務で今すぐ使えるオープンソースツール群を公開しています。
▶︎NVIDIAが公開した研究フレームワークによる安全性評価

NVIDIAは、AIエージェントやLLMアプリケーションの安全性を動的に評価・制御するためのオープンソースフレームワークを積極的に公開しています。
その代表例が「NeMo Guardrails」です。同ツールは、NVIDIAが以前より提供しているオープンソースフレームワークで、ユーザーからのプロンプト入力時およびAIからの生成結果出力時、さらには外部のRAG(検索拡張生成)ドキュメントを参照する際の中間レイヤーとして機能し、不適切な指示や悪意ある命令がシステムに届かないようリアルタイムで検知・遮断・サニタイズ(無害化)します。(参考:7)
NVIDIAはこれに加え、AIエージェントの動作をテスト・トレース・監査・ガバナンスしやすくするオープンソースの研究フレームワーク「NOOA(NVIDIA Labs Object-Oriented Agent)」の研究成果もOSAAを通じてコミュニティに提供しています。このフレームワークはメモリポイズニングや間接プロンプトインジェクションへの耐性評価にも応用可能です。(参考:8)
▶︎Microsoft・IBMが提供するAIセキュリティツール群

OSAAの設立メンバーであるMicrosoftとIBM・Red Hatも、エンタープライズ領域で培ったAIセキュリティ技術をOSAAへ持ち寄っています。
MicrosoftはOSAAへの貢献として、複数の専門AIエージェントが協調して大規模コードベース内のソフトウェア脆弱性を自動で発見・証明・修正する「MDASH(マルチモデル・エージェント型スキャンハーネス)」を提供しています。また、AIエージェントへの直接・間接プロンプトインジェクション攻撃をリアルタイムで検出・ブロックする「Prompt Shields(Azure AI Content Safety)」も提供しており、外部データ参照時の攻撃経路を遮断します。(参考:9,10,11)
IBM・Red HatはOSAAへの貢献として、AIエージェントが依存するオープンソース・ソフトウェアのサプライチェーン全体をデジタル署名済みパッチで保護する「Lightwell」を提供しています。また、IBM独自のAIセキュリティ製品「IBM Guardium AI Security」は、エージェントへのプロンプトインジェクション・ジェイルブレイク試行・敵対的入力をリアルタイムで検出します。(参考:12,13,14,15)
これらOSAA加盟各社が提供するオープンソースツールは、OSAAの標準化された評価メトリクスと組み合わせることで、組織横断的なAIセキュリティ比較を可能にします。
▶︎Hugging Faceによる「Safetensors」の移管と、各社が持ち寄る防衛アプローチ

従来のモデル保存形式(Pickle)には、ファイルを読み込むだけで悪意あるコードを実行させる「Pickling攻撃」の深刻な脆弱性が存在しました。このリスクを排除するため、Hugging Faceは安全なテンソル保存形式「Safetensors」を開発し、Linux Foundation傘下のPyTorch Foundationへ移管しました。(参考:16,17)
これにより「Safetensors」は特定の単一ベンダーに依存しないグローバルな共通安全規格としての地位を確立。「Safetensors」の移管は、OSAAが目指す「オープンな防衛エコシステム」と同じ方向性を持った、先駆けとなる事例です。
こうした動きはHugging Faceにとどまりません。HPEはAIエージェントやサービスを暗号学的に検証するゼロトラスト・アイデンティティ標準「SPIFFE/SPIRE」への貢献を提供し、SpaceXAI(旧:xAI)はAIエージェントコーディングツール「Grok Build」をオープンソース化しました。
各社が優れた独自技術をオープンコミュニティへ持ち寄ることで、ベンダーロックインを回避しつつ、追跡可能かつ検証可能な「オープンな防衛エコシステム」の共創が進んでいます。
※Pickling攻撃:Pythonのシリアライズ形式「Pickle」を悪用し、モデルファイルにマルウェアコードを埋め込む攻撃。モデルのロード時に自動実行される。

企業が講じるべき「AIエージェントセキュリティ」4つの最新防衛策

1. エージェント向けID・アクセス管理(IAM)の徹底で権限昇格を防ぐ

AIエージェントには、業務を遂行するために必要な最小限の権限のみを付与する「最小権限の原則」を徹底しなければなりません。API実行やデータベースアクセスの権限上限を厳密に設定し、悪意ある命令による不必要な権限昇格を技術的に防ぎます。
これにより、間接プロンプトインジェクション等によってエージェントの制御が一時的に乗っ取られたとしても、攻撃者がエージェントの権限を昇格させて社内の基幹データベースを不正に削除したり、不正送金を実行したりする致命的な被害を未然に防ぐことができます。
AIエージェント向けIAMチェックリスト●最小権限の原則:エージェントに必要最低限の権限のみ付与し、定期的に見直す ●エージェント専用ID発行:人間ユーザーと区別した専用サービスアカウントを使用 ●権限昇格の監視:エージェントが自ら権限を拡張しようとする動作を検知・遮断 ●シークレット管理:APIキーや認証情報をコードに直書きせず、Vault等の専用ツールで管理 ●アクセスログの記録・監査:エージェントのすべてのAPI呼び出しをログ化し定期監査 |
2. AI Firewallとリアルタイム監視による「AI暴走」の即時抑制

AIエージェントの暴走を未然に防ぐには、入力・出力・外部データ参照の経路に常時稼働のセキュリティ層「AI Firewall」を導入することが不可欠です。

具体的には、社内ネットワークの中継ポイントに「プロンプトDLP(データ損失防止)」を配置し、自然言語処理(NLP)で文脈を解析します。送信前にプロンプトインジェクションや機密情報の流出リスクを検知・遮断することで、悪意ある指示の実行を防ぎます。
あわせて、AIからの出力や外部API呼び出しもリアルタイムで監視します。異常なリクエスト頻度や意図しない動作の兆候を検知した瞬間、キルスイッチを発動して即座に強制停止させる仕組みを構築します。さらに、重要処理には人間の承認を求める「HITL(Human-in-the-Loop)」フローを組み込むことで、実害への発展を二重の防御で防止します。
3. メモリポイズニング対策:コンテキストの定期クレンジングと隔離

AIエージェントの長期記憶を健全に保つには、技術・運用の両面から多層的なアプローチが必要です。以下の3ステップで、メモリポイズニングとコンテキスト漏えいのリスクを防ぎます。

●コンテキストの定期的クレンジング
AIエージェントが保持する短期・長期の対話履歴やキャッシュデータを定期的にスキャンし、そこに顧客の個人情報(マイナンバー、クレジットカード番号、病歴など)や不適切な命令が含まれていないかをクレンジング(削除またはマスキング)します。
●プロンプト匿名化(置換)技術の活用
AIエージェントに社外のLLMエンジンを利用させる場合、データを送信する手前で、プロンプト内に含まれる「個人名」や「会社名」を自動で仮の文字列([人物A]、[組織B]など)にマスキング(匿名化)して送信します。AIから返ってきた回答を社内のシステム画面に表示する瞬間に、元のデータ([人物A] = 山田太郎)にリアルタイムで「復元(再置換)」します。これにより、外部への情報露出をゼロにしながらAIの正確な推論能力を最大限に引き出すことが可能になります。(AIの精度とセキュリティの両立)
●セッション(会話セグメント)の分離とリセット
業務タスクが完了した段階、あるいは1日の業務終了時に、一時的なセッションデータを完全にリセットし、過去のコンテキストが次の無関係な業務対話に引き継がれないよう、コンテキスト境界を物理的に隔離します。
4. OSAA標準を見据えたAIガバナンスフレームワークと社内ルールの策定

技術的なセキュリティ対策をいくら強化しても、組織的なガバナンスが欠落していれば、従業員が勝手に未承認のモデルやツールを持ち込む「シャドーAI」や、開発者が個人のPCで動作させる「野良LLM(未管理のローカルLLM)」の乱立を防ぐことはできません。
OSAAなどのグローバルなオープン標準の動向を注視し、開発者・運用者・利用者の「責任の所在」を明確化したガイドラインを策定することが重要です。(参考:21,22)
「PoC(概念実証)」から本格運用へシフトする段階で、セキュリティ評価を開発ライフサイクルに組み込む体制を整備しましょう。

まとめ
AIエージェントの脆弱性対策とオープン防衛が企業の競争力を左右する

AIエージェントの登場は、ビジネスプロセスの完全自律化という壮大なビジョンをもたらした一方で、「間接プロンプトインジェクション」や「長期記憶へのメモリポイズニング」といった、従来型のネットワークセキュリティやクローズドなAIガードレールでは絶対に防ぎきれない、極めて複雑なセキュリティリスクを企業に突きつけています。
このような状況下で、NVIDIAをはじめとするグローバルリーダーが主導する「OSAA」の登場は、AIセキュリティが「秘密主義のガードレール」から「透明性の高いオープン防衛」へと舵を切ったことを示しています。企業は最新の業界標準や防御ツールを取り入れ、ガバナンスと技術的防衛策の双方を速やかに構築することが求められます。

出典・参考一覧
NVIDIA Corporation「Industry Leaders Unite in Open Secure AI Alliance for AI Safety and Security」
https://blogs.nvidia.com/blog/open-secure-ai-alliance/
ZDNet Japan「NVIDIA、「Open Secure AI Alliance」を設立--OSS脆弱性をAIで解決」
https://japan.zdnet.com/article/35251002/
ITmedia NEWS「NVIDIAやMicrosoftなど30社超、オープンAIの防御ツール共同開発の「Open Secure AI Alliance」設立」
https://www.itmedia.co.jp/news/article/2607/28/1260728059/
Hugging Face「Security incident disclosure — July 2026」
https://huggingface.co/blog/security-incident-july-2026
トレンドマイクロ「OpenAIとHugging Faceのインシデントの裏側:人間が関与していないAIによる侵害」
https://www.trendmicro.com/ja_jp/research/26/g/inside-the-openai-hugging-face-incident.html
Internet Watch「OpenAI、サイバー攻撃能力テスト中のAIモデルがHugging Faceに不正アクセスしたと発表」
https://internet.watch.impress.co.jp/docs/news/2127303.html
NVIDIA Corporation「NeMo Guardrails とは(日本語解説ページ)」
https://resources.nvidia.com/ja-jp-generative-ai/nvidia-enables-trust
NVIDIA Corporation「Six Agent Harness Capabilities for Higher Model Performance」
https://developer.nvidia.com/blog/six-agent-harness-capabilities-for-higher-model-performance/
Microsoft Corporation「AI スピードに対応した防御:Microsoft の新たなマルチモデル エージェント型スキャン システム(日本語)」
Microsoft Corporation「Securing AI agents: AI tools move from reading to acting」
Microsoft Corporation「Prompt Shields in Azure AI Content Safety」
https://learn.microsoft.com/en-us/azure/ai-services/content-safety/concepts/jailbreak-detection
IBM Corporation「Lightwell」
https://www.ibm.com/products/lightwell
Red Hat, Inc.「Lightwell」
https://www.redhat.com/en/lightwell
ZDNet Japan「IBMとRed Hat、「Project Lightwell」を発表--約8000億円を投資」
https://japan.zdnet.com/article/35248263/
IBM Corporation「IBM Guardium」
https://www.ibm.com/products/guardium
Hugging Face「Safetensors is Joining the PyTorch Foundation」
https://huggingface.co/blog/safetensors-joins-pytorch-foundation
PyTorch Foundation「PyTorch Foundation Announces Safetensors as Newest Contributed Project to Secure AI Model Execution」
OWASP Gen AI Security Project「大規模言語モデル(LLM)アプリケーションに関するOWASP Top 10(日本語版)」 https://genai.owasp.org/resource/大規模言語モデル(llm)アプリケーションに関するOWASP-Top-10/
OWASP Gen AI Security Project「OWASP Top 10 for Agentic Applications 2026」
https://genai.owasp.org/resource/owasp-top-10-for-agentic-applications-for-2026/
Stellar Cyber「エージェント型AIを標的とした自律型サイバー脅威と防御策の必要性」
https://stellarcyber.ai/ja/learn/agentic-ai-securiry-threats/
米国国立標準技術研究所(NIST)「AI Agent Standards Initiative」
https://www.nist.gov/artificial-intelligence/ai-agent-standards-initiative
AIセーフティ・インスティテュート「NIST AI リスクマネジメントフレームワーク(AI RMF)日本語翻訳版」







