应对大语言模型中的过度拒答
计算与语言
2024-02-01 v1 人工智能
摘要
大语言模型经过精心对齐,以确保既有用又无害。然而,最近的研究指出了一种潜在的过度拒答现象,即模型可能会拒绝回答良性查询。在本文中,我们通过探索模型如何处理和判定查询的安全性,研究了过度拒答的因素。我们的发现揭示了模型内部存在捷径,导致对诸如“kill”等有害词汇的过度关注,而强调安全性的提示会加剧过度拒答。基于这些见解,我们引入了自对比解码 (Self-CD),一种无需训练且与模型无关的策略,以缓解这一现象。我们首先通过放大模型在响应包含或省略安全性强调的系统提示时的输出分布差异,来提取这种过度关注。然后,我们通过对比解码削弱模型的过度关注,以确定最终的下一词元预测。实证结果表明,我们的方法实现了平均 20% 的拒答率降低,同时对安全性几乎没有影响。
引用
@article{arxiv.2401.17633,
title = {Navigating the OverKill in Large Language Models},
author = {Chenyu Shi and Xiao Wang and Qiming Ge and Songyang Gao and Xianjun Yang and Tao Gui and Qi Zhang and Xuanjing Huang and Xun Zhao and Dahua Lin},
journal= {arXiv preprint arXiv:2401.17633},
year = {2024}
}