中文

M2S:大语言模型红队测试中的多轮到单轮越狱

计算与语言 2025-08-06 v3 人工智能

摘要

我们提出了一种新颖的框架,用于将多轮对抗性「越狱」提示整合为单轮查询,显著减少了对大语言模型(LLM)进行对抗测试所需的人工开销。虽然多轮人工越狱已被证明能产生高攻击成功率,但它们需要大量的人工努力和时间。我们的多轮到单轮(M2S)方法——Hyphenize、Numberize 和 Pythonize——系统地将多轮对话重新格式化为结构化的单轮提示。尽管去除了迭代的双向交互,这些提示保留并往往增强了对抗效力:在多轮人工越狱(MHJ)数据集上的广泛评估中,M2S 方法在多个最先进的 LLM 上实现了 70.6% 到 95.9% 的攻击成功率。值得注意的是,单轮提示在平均将令牌使用量减少一半以上的同时,比原始多轮攻击高出多达 17.5 个百分点的攻击成功率。进一步分析表明,将恶意请求嵌入枚举或类代码结构中利用了「上下文盲区」,绕过了原生护栏和外部输入输出过滤器。通过将多轮对话转换为简洁的单轮提示,M2S 框架为大规模红队测试提供了一个可扩展的工具,并揭示了当代 LLM 防御中的关键弱点。

关键词

引用

@article{arxiv.2503.04856,
  title  = {M2S: Multi-turn to Single-turn jailbreak in Red Teaming for LLMs},
  author = {Junwoo Ha and Hyunjun Kim and Sangyoon Yu and Haon Park and Ashkan Yousefpour and Yuna Park and Suhyun Kim},
  journal= {arXiv preprint arXiv:2503.04856},
  year   = {2025}
}

备注

Accepted to ACL 2025 (Main Track). Camera-ready version