将越狱视为奖励误指定问题
机器学习
2025-04-22 v5 计算与语言
摘要
大型语言模型(LLM)的广泛采用引发了关于其安全性和可靠性的关注,尤其是其对对抗性攻击的脆弱性。本文提出一种新视角,将这种脆弱性归因于对齐过程中奖励函数的误指定。当奖励函数未能准确捕捉预期行为时,将导致模型输出产生偏差。我们引入 ReGap 指标来量化奖励误指定的程度,并证明其在检测有害后门提示方面的有效性和鲁棒性。基于这些见解,我们提出了 ReMiss—a 用于自动红队测试的系统,通过在奖励误指定的空间中生成对抗性提示。ReMiss 在针对 various目标对齐 LLM 的 AdvBench基准测试中实现了最高的攻击成功率,同时保持生成提示的人类可读性。此外,这些针对开源模型的攻击在封闭源模型如 GPT-4o 以及来自 HarmBench 的超分布任务上表现出高度可迁移性。详细分析突显了所提出奖励误指定目标相较于先前方法的独特优势,为改进 LLM 的安全性和鲁棒性提供新见解。
引用
@article{arxiv.2406.14393,
title = {Jailbreaking as a Reward Misspecification Problem},
author = {Zhihui Xie and Jiahui Gao and Lei Li and Zhenguo Li and Qi Liu and Lingpeng Kong},
journal= {arXiv preprint arXiv:2406.14393},
year = {2025}
}
备注
Accepted to ICLR 2025. Code: https://github.com/zhxieml/remiss-jailbreak