解码 LLM 中的潜在攻击面:基于 HTML 的网页总结注入攻击
密码学与安全
2025-11-12 v3 人工智能
摘要
大型语言模型 (LLM) 日益集成到基于网页的内容总结系统中,但其对提示注入攻击的脆弱性仍是一个迫切的关注点。本研究探讨了如何利用不可见的 HTML 元素(如 <meta>、aria-label 和 alt 属性)在不改变网页可见内容的情况下嵌入对抗性指令。我们引入了一个新型数据集,包含 280 个静态网页,干净版本与对抗性注入版本各占 140 个,通过多样化的 HTML 基于策略构建。这些网页通过浏览器自动化管道处理,以提取原始 HTML 和渲染文本,紧密模拟实际的 LLM 部署场景。我们对两个最先进的开源模型——Llama 4 Scout (Meta) 和 Gemma 9B IT (Google)——进行评估,评估其对该内容进行总结的能力。通过词汇指标 (ROUGE-L) 和语义指标 (SBERT 余弦相似度) 以及人工标注,我们评估这些隐蔽注入的影响。我们的发现表明,超过 29% 的注入样本导致 Llama 4 Scout 总结出现可察觉的变化,而 Gemma 9B IT 的成功率较低,但仍达到了 15%。这些结果凸显了 LLM 驱动的网页管道中一个关键且鲜为人知的漏洞,隐藏的对抗内容能够微妙地操纵模型输出。我们的工作提供了一个可复现的框架和基准,用于评估 HTML 基于的提示注入,并强调在涉及网页内容的 LLM 应用中亟需 robust 抗击策略。
引用
@article{arxiv.2509.05831,
title = {Decoding Latent Attack Surfaces in LLMs: Prompt Injection via HTML in Web Summarization},
author = {Ishaan Verma and Arsheya Yadav},
journal= {arXiv preprint arXiv:2509.05831},
year = {2025}
}