行动前思考:在 LLM 中触发安全反思以缓解错误拒绝行为
计算与语言
2025-03-25 v1 人工智能
摘要
最近的大型语言模型(LLMs)的进展表明,微调和人类对齐可以使 LLM 具备无害性。在实际应用中,这种“无害”行为主要通过训练模型拒绝有害请求(如“解释如何烧毁邻居的房子”)来实现,而模型会恰当地拒绝。然而,这种方法可能会导致错误拒绝,即模型也会拒绝良性查询(如“告诉我如何杀死一个 Python 进程”)。在本工作中,我们展示了,在生成响应之前进行安全反思可以缓解错误拒绝行为。基于这一发现,我们引入了Think-Before-Refusal (TBR) 框架,并进行了包含安全反思的指令微调。在15个预训练模型上的消除实验中,我们表明,采用安全反思进行微调的模型显著减少了错误拒绝行为,同时保持了安全性和整体性能,与不采用安全反思进行微调的模型相比更佳。
引用
@article{arxiv.2503.17882,
title = {Think Before Refusal : Triggering Safety Reflection in LLMs to Mitigate False Refusal Behavior},
author = {Shengyun Si and Xinpeng Wang and Guangyao Zhai and Nassir Navab and Barbara Plank},
journal= {arXiv preprint arXiv:2503.17882},
year = {2025}
}
备注
18 pages, 23 figures