野外间接提示注入:实证研究其流行性、技术与目标
密码学与安全
2026-05-01 v1
摘要
随着LLM被集成到浏览、检索、概述和执行网页内容的系统中,网页已成为下游模型行为的不可信输入向量。这使网站所有者、贡献者和对手能够嵌入直接指令,即间接提示注入。虽然先前工作在受控环境中演示了此类攻击,但其流行性、部署和实际影响仍不清楚。我们对网页和HTTP响应中间接提示注入的大规模实证分析之一。分析 120 亿个URL来自 2480 万个主机,识别出 1.53 万个验证实例覆盖 1.17 万个页面。这些并非孤立案例:少数重复模板占多数案例。我们描述了其目标、交付机制、可见性、持久性和影响,揭示了涉及破坏性提示、声誉操纵、内容保护指令和AI机器人检测的异构生态系统,目标系统包括爬虫、搜索管道、客户支持代理和招聘工作流程。关键发现是,大多数指令针对机器而非人类:约 70% 出现在非渲染HTML中(如标题、注释、元数据),许多可见案例通过渲染技术隐藏。为评估实际风险,我们在 13 个模型和四种网页表示上进行 5200 个受控实验。结果表明合规性有限但不容忽视,小型模型在纯文本输入上可达最高 8%,而结构化表示通过保持结构线索减少合规性。总体而言,基于提示的干扰已存在于网页生态系统中,代表了LLM驱动的自动化与其消耗站点之间的日益紧张关系。
引用
@article{arxiv.2604.27202,
title = {Indirect Prompt Injection in the Wild: An Empirical Study of Prevalence, Techniques, and Objectives},
author = {Soheil Khodayari and Xuenan Zhang and Bhupendra Acharya and Giancarlo Pellegrino},
journal= {arXiv preprint arXiv:2604.27202},
year = {2026}
}
备注
18 pages total, 12 pages main content, 8 figures, and 12 tables