中文

回音室:一种多轮大语言模型越狱攻击

密码学与安全 2026-01-12 v1 人工智能

摘要

大语言模型(LLMs)的可用性催生了新一代能以相对较低成本开发的强大聊天机器人。随着企业部署这些工具,需要解决安全挑战以防止财务损失和声誉损害。一个关键的安全挑战是越狱攻击,即恶意操纵提示和输入以绕过聊天机器人的安全护栏。多轮攻击是一种相对较新的越狱形式,涉及与聊天机器人进行精心设计的交互链。我们引入了Echo Chamber,一种采用逐步升级方法的新型多轮攻击。我们详细描述了这种攻击,将其与其他多轮攻击进行了比较,并通过广泛的评估展示了其针对多个最先进模型的性能。

关键词

引用

@article{arxiv.2601.05742,
  title  = {The Echo Chamber Multi-Turn LLM Jailbreak},
  author = {Ahmad Alobaid and Martí Jordà Roca and Carlos Castillo and Joan Vendrell},
  journal= {arXiv preprint arXiv:2601.05742},
  year   = {2026}
}