中文

多示例攻击中真正重要的是什么?一项关于大语言模型长上下文漏洞的实证研究

计算与语言 2025-05-27 v1 密码学与安全

摘要

我们通过多示例越狱攻击(MSJ)研究大语言模型(LLM)中的长上下文漏洞。我们的实验使用了高达 128K token 的上下文长度。通过对具有不同指令风格、示例密度、主题和格式的各种多示例攻击设置进行全面分析,我们揭示了上下文长度是决定攻击有效性的首要因素。关键的是,我们发现成功的攻击不需要精心设计的有害内容。即使是重复的示例或随机的虚拟文本也能绕过模型的安全措施,这表明 LLM 在长上下文处理能力上存在根本性局限。随着上下文变长,对齐良好的模型的安全行为会变得越来越不一致。这些发现凸显了 LLM 在上下文扩展能力方面的重大安全缺口,强调了开发新型安全机制的必要性。

关键词

引用

@article{arxiv.2505.19773,
  title  = {What Really Matters in Many-Shot Attacks? An Empirical Study of Long-Context Vulnerabilities in LLMs},
  author = {Sangyeop Kim and Yohan Lee and Yongwoo Song and Kimin Lee},
  journal= {arXiv preprint arXiv:2505.19773},
  year   = {2025}
}

备注

Accepted by ACL 2025