中文

将越狱视为奖励误指定问题

机器学习 2025-04-22 v5 计算与语言

摘要

大型语言模型(LLM)的广泛采用引发了关于其安全性和可靠性的关注,尤其是其对对抗性攻击的脆弱性。本文提出一种新视角,将这种脆弱性归因于对齐过程中奖励函数的误指定。当奖励函数未能准确捕捉预期行为时,将导致模型输出产生偏差。我们引入 ReGap 指标来量化奖励误指定的程度,并证明其在检测有害后门提示方面的有效性和鲁棒性。基于这些见解,我们提出了 ReMiss—a 用于自动红队测试的系统,通过在奖励误指定的空间中生成对抗性提示。ReMiss 在针对 various目标对齐 LLM 的 AdvBench基准测试中实现了最高的攻击成功率,同时保持生成提示的人类可读性。此外,这些针对开源模型的攻击在封闭源模型如 GPT-4o 以及来自 HarmBench 的超分布任务上表现出高度可迁移性。详细分析突显了所提出奖励误指定目标相较于先前方法的独特优势,为改进 LLM 的安全性和鲁棒性提供新见解。

关键词

引用

@article{arxiv.2406.14393,
  title  = {Jailbreaking as a Reward Misspecification Problem},
  author = {Zhihui Xie and Jiahui Gao and Lei Li and Zhenguo Li and Qi Liu and Lingpeng Kong},
  journal= {arXiv preprint arXiv:2406.14393},
  year   = {2025}
}

备注

Accepted to ICLR 2025. Code: https://github.com/zhxieml/remiss-jailbreak