当感到不安全时拒绝:通过解耦式拒绝训练提升LLM安全性
计算与语言
2025-05-26 v2 人工智能
摘要
本研究针对大型语言模型(LLM)安全调优实践中的一个关键缺口,识别并解决了该 practice 中存在的拒绝位置偏置问题,这会损害模型对不当拒绝生成不安全内容的能力。我们提出一种 novel 方法,即解耦式拒绝训练(DeRTa),旨在使LLM能够在任何响应位置拒绝对有害提示的合规,从而显著提升其安全能力。DeRTa 包含两个 novel 组件:(1)带有有害响应前缀的最大似然估计(MLE),用于训练模型识别并避免不安全内容,通过在安全响应开头追加一段有害响应来实现;(2)强化过渡优化(RTO),使模型能够在有害响应序列中的各个位置一致地从潜在危害过渡到安全拒绝。我们的实证评估使用LLaMA3和Mistral模型系列,涵盖六种攻击情景,结果表明该方法不仅在不损害性能的情况下提升了模型安全性,而且在对抗攻击方面超越了基线方法。
引用
@article{arxiv.2407.09121,
title = {Refuse Whenever You Feel Unsafe: Improving Safety in LLMs via Decoupled Refusal Training},
author = {Youliang Yuan and Wenxiang Jiao and Wenxuan Wang and Jen-tse Huang and Jiahao Xu and Tian Liang and Pinjia He and Zhaopeng Tu},
journal= {arXiv preprint arXiv:2407.09121},
year = {2025}
}
备注
Accepted by ACL 2025 main