通过自适应对比解码缓解大语言模型的过度拒绝问题
计算与语言
2026-04-21 v1
摘要
安全对齐的大语言模型( LLM)由于过度拒绝问题,常常会对无害查询生成拒绝响应。然而,现有的缓解过度拒绝的方法无法在保持对恶意查询高拒绝率的同时,维持对无害查询的低拒绝率。本文分析了不同安全水平的系统提示如何影响面对过度拒绝查询时的LLM拒绝行为。我们观察到一个关键事实:当LLM出现过度拒绝问题时,下一令牌候选列表中仍然存在非拒绝令牌,但模型系统性地未能选择它们,尽管生成拒绝令牌。基于这一观察,我们提出了一种训练-free且模型无关的方法——自适应对比解码( AdaCD)——在保持LLM安全性的同时缓解过度拒绝问题。首先,AdaCD比较带或不带极端安全系统提示的LLM输出分布,以细化拒绝令牌分布。其次,我们引入一种自适应对比解码策略,动态地包含或移除拒绝令牌分布,自适应地提高选择拒绝或非拒绝令牌的概率。在五个基准数据集上的实验结果表明,AdaCD平均减少了10.35%的过度拒绝查询拒绝率,但仍将恶意查询的拒绝率提高了0.13%。代码已公开https://github.com/OutdoorManofML/AdaCD。
引用
@article{arxiv.2604.17132,
title = {Please refuse to answer me! Mitigating Over-Refusal in Large Language Models via Adaptive Contrastive Decoding},
author = {Yupeng Qi and Ziyu Lyu and Lixin Cui and Lu Bai and Feng Xia},
journal= {arXiv preprint arXiv:2604.17132},
year = {2026}
}
备注
Accepted by ACL 2026 Main Conference