中文

AttnTrace:基于提示注入与知识损坏的情境归因

计算与语言 2026-04-21 v3 密码学与安全

摘要

长上下文大语言模型(LLM),如 Gemini-2.5-Pro 和 Claude-Sonnet-4,正逐渐被用于赋能高级人工智能系统,包括检索增强生成(RAG)管道和自主代理。在这些系统中,LLM 会接收一条指令以及上下文——通常由来自知识库或记忆中检索到的文本组成——并生成一个由遵循指令而产生的、受上下文制约的响应。近期研究设计了解决方案,用于追溯 LLM 生成响应时贡献最大的上下文子集文本。这些解决方案在实际应用中具有诸多价值,包括执行事后攻击取证分析以及提高 LLM 输出的可解释性和可信度。尽管已有大量努力,但诸如 TracLLM 等最新方法往往导致高计算成本,例如,TracLLM 需要数百秒才能对单个响应-上下文对执行追溯。本文提出了 AttnTrace,一种基于 LLM 针对提示生成的注意力权重的上下文追溯方法。为有效利用注意力权重,我们引入了两项技术来增强 AttnTrace 的有效性,并提供理论见解以支持我们的设计选择。我们还对 AttnTrace 进行了系统评估。结果表明,AttnTrace 在准确性和效率上均优于现有的领先上下文追溯方法。我们还展示了 AttnTrace 通过归因-检测范式,能够提高检测长上下文中提示注入的最先进方法的性能。作为实际应用,我们演示了 AttnTrace 能够有效定位纸张中被设计用来操纵 LLM 生成评论的注入指令。代码地址为 https://github.com/Wang-Yanting/AttnTrace。

关键词

引用

@article{arxiv.2508.03793,
  title  = {AttnTrace: Contextual Attribution of Prompt Injection and Knowledge Corruption},
  author = {Yanting Wang and Runpeng Geng and Ying Chen and Jinyuan Jia},
  journal= {arXiv preprint arXiv:2508.03793},
  year   = {2026}
}

备注

To appear in IEEE S&P 2026. The code is available at https://github.com/Wang-Yanting/AttnTrace. The demo is available at https://huggingface.co/spaces/SecureLLMSys/AttnTrace