中文

克服检索障碍:大语言系统中野生间接提示注入

密码学与安全 2026-01-13 v1 人工智能

摘要

大型语言模型(LLMs)越来越依赖从外部语料库中检索信息。这创造了新的攻击面:间接提示注入(IPI),其中隐藏指令被植入语料库中,并在检索后劫持模型行为。以往研究已凸显这一风险,但常回避最困难的步骤:确保恶意内容实际被检索。在实际情况下,未优化的IPI在自然查询下很少被检索,这使其实际影响尚不清晰。我们通过将恶意内容分解为保证检索的触发片段以及编码任意攻击目标的攻击片段来解决这一挑战。基于此思想,我们设计了一种高效且有效的黑盒攻击算法,用以构建紧凑的触发片段,以确保针对任何攻击片段的检索。该攻击仅需对嵌入模型的API访问权限,成本效益高(仅需0.21美元即可针对目标用户查询),并在11个基准测试和8个嵌入模型(包括开源模型和专有服务)上实现近乎100%的检索率。基于本攻击,我们呈现了在自然查询和现实语料库下的首个端到端IPI攻击,涵盖RAG系统和智能体系统,具有多样化的攻击目标。这些结果确立了IPI作为一种实用且严重的威胁:当用户发出自然查询请求总结频繁询问的话题邮件时,仅一个被毒化的邮件即可使GPT-4o在多智能体工作流程中成功将SSH密钥外泄超过80%。我们进一步评估了Several防御措施,发现它们不足以防止恶意文本的检索,凸显检索作为一个关键的开放性漏洞。

关键词

引用

@article{arxiv.2601.07072,
  title  = {Overcoming the Retrieval Barrier: Indirect Prompt Injection in the Wild for LLM Systems},
  author = {Hongyan Chang and Ergute Bao and Xinjian Luo and Ting Yu},
  journal= {arXiv preprint arXiv:2601.07072},
  year   = {2026}
}