中文

InfoFlood:基于信息过载的大型语言模型攻击

密码学与安全 2025-06-17 v1 计算与语言

摘要

大型语言模型(LLM)在各个领域展现出惊人的能力,但其生成有害响应的潜力也引发了重大的社会和监管关切,尤其是当被对抗性技术称为“越狱”攻击时。现有的越狱方法通常涉及向恶意提示添加精心设计的前缀或后缀,以规避这些模型的内置安全机制。在本工作中,我们识别了一种新漏洞,即过度的语言复杂性可以扰乱内置安全机制——无需任何添加的前缀或后缀,即可让攻击者直接触发有害输出。我们称这种现象为信息过载。为自动利用此漏洞,我们提出InfoFlood,一种能够将恶意查询转化为具备信息过载能力的查询,以规避内置安全机制的越狱攻击。具体而言,InfoFlood:(1)使用语言转换重新表述恶意查询;(2)识别失败尝试的根本原因;(3)在保留恶意意图的同时,调整查询的语言结构以解决失败问题。我们在四个广泛使用的 LLM 上进行了实证验证,包括 GPT-4o、GPT-3.5-turbo、Gemini 2.0 和 LLaMA 3.1,通过测量其越狱成功率。InfoFlood 在多个越狱基准测试中始终优于基线攻击,成功率提升最高可达 3 倍。此外,我们展示了包括 OpenAI 的 Moderation API、Perspective API 和 SmoothLLM 等常用后处理防御措施无法缓解这些攻击。这凸显了当面对信息过载式越狱时,传统 AI 安全防线的关键性弱点。

关键词

引用

@article{arxiv.2506.12274,
  title  = {InfoFlood: Jailbreaking Large Language Models with Information Overload},
  author = {Advait Yadav and Haibo Jin and Man Luo and Jun Zhuang and Haohan Wang},
  journal= {arXiv preprint arXiv:2506.12274},
  year   = {2025}
}