回音室:一种多轮大语言模型越狱攻击
密码学与安全
2026-01-12 v1 人工智能
摘要
大语言模型(LLMs)的可用性催生了新一代能以相对较低成本开发的强大聊天机器人。随着企业部署这些工具,需要解决安全挑战以防止财务损失和声誉损害。一个关键的安全挑战是越狱攻击,即恶意操纵提示和输入以绕过聊天机器人的安全护栏。多轮攻击是一种相对较新的越狱形式,涉及与聊天机器人进行精心设计的交互链。我们引入了Echo Chamber,一种采用逐步升级方法的新型多轮攻击。我们详细描述了这种攻击,将其与其他多轮攻击进行了比较,并通过广泛的评估展示了其针对多个最先进模型的性能。
引用
@article{arxiv.2601.05742,
title = {The Echo Chamber Multi-Turn LLM Jailbreak},
author = {Ahmad Alobaid and Martí Jordà Roca and Carlos Castillo and Joan Vendrell},
journal= {arXiv preprint arXiv:2601.05742},
year = {2026}
}