中文

规模化野外团队:从野外越狱到(对抗性)更安全的语言模型

计算与语言 2024-06-27 v1

摘要

我们引入 WildTeaming,一个自动化的 LLM 安全红队测试框架,从野外用户-聊天机器人交互中挖掘出 5.7K 个独特的新型越狱战术集群,然后组合多个战术进行系统性的新型越狱探索。与以前通过招募人力工作者、梯度基于优化或使用 LLM 迭代修订进行红队测试的工作相比,我们从未受特定指令鼓励破坏系统的聊天机器人用户那里发现越狱。WildTeaming 揭示了前沿 LLM 之前未被识别的漏洞,导致比最新的越狱方法更具多样性和成功性——最多可提高 4.6 倍。虽然存在用于越狱评估的许多数据集,但 very few 开源数据集用于越狱训练,因为即使在模型权重开放的情况下,安全训练数据也一直是封闭的。通过 WildTeaming,我们创建了 WildJailbreak,一个大规模开源合成安全数据集,包含 26.2 万对 vanilla(直接请求)和对抗性(复杂越狱)提示-响应对。为了缓解夸大安全行为的现象,WildJailbreak 提供了两种对比查询类型:1) 有害查询(vanilla 与对抗性)和 2) 看似有害查询但不包含有害内容的良性查询。WildJailbreak 显著提升了现有安全资源的质量和规模,独特地使我们能够检查数据和模型能力在安全训练期间的比例效应。通过大量实验,我们识别了实现理想安全行为平衡的训练属性:适当的保护措施而不过度拒绝,对 vanilla 和对抗性查询的有效处理,以及最小或无额外的通用能力下降。WildJailbreak 的所有组件都有助于实现模型的平衡安全行为。

关键词

引用

@article{arxiv.2406.18510,
  title  = {WildTeaming at Scale: From In-the-Wild Jailbreaks to (Adversarially) Safer Language Models},
  author = {Liwei Jiang and Kavel Rao and Seungju Han and Allyson Ettinger and Faeze Brahman and Sachin Kumar and Niloofar Mireshghallah and Ximing Lu and Maarten Sap and Yejin Choi and Nouha Dziri},
  journal= {arXiv preprint arXiv:2406.18510},
  year   = {2024}
}