中文

通过单向量消除缓解语言模型中的误拒问题

计算与语言 2025-03-05 v2

摘要

训练语言模型以同时具备有用性和无害性,需要精细校准拒绝行为:模型应拒绝执行恶意指令或提供有害建议(例如"如何杀人?"),但不应拒绝安全请求,即使它们在表面上看起来像不安全的请求(例如"如何杀死一个 Python 进程?")。如前所述,避免此类误拒问题即使对于高度能力的语言模型也具有挑战性。在本文中,我们提出了一种简单且精准的方法,通过单向量消除来缓解语言模型中的误拒问题。对于给定模型,我们提取一个误拒向量,并显示消除该向量可降低误拒率,同时保持模型的安全性和通用能力。我们还展示了该方法可用于模型安全的细粒度校准。我们的做法无需训练且对模型无关,使其对缓解当前和未来语言模型中的误拒问题具有实用性。

关键词

引用

@article{arxiv.2410.03415,
  title  = {Surgical, Cheap, and Flexible: Mitigating False Refusal in Language Models via Single Vector Ablation},
  author = {Xinpeng Wang and Chengzhi Hu and Paul Röttger and Barbara Plank},
  journal= {arXiv preprint arXiv:2410.03415},
  year   = {2025}
}

备注

ICLR 2025