中文

拒绝标记:大语言模型拒绝响应校准的简单方法

机器学习 2025-09-01 v2 计算与语言

摘要

构建安全可靠的语言模型的一个关键环节是使模型能够相应地拒绝执行某些指令或回答某些问题。我们可能希望模型对各种类别的用户查询输出拒绝消息,例如非严肃问题、实施非法活动的指令或需要模型知识范围之外信息的查询。工程化能够按不同类别产生拒绝响应的模型复杂,由于个体可能希望其模型对不同类别查询的拒绝灵敏度不同,不同用户也可能希望不同的拒绝率。当前默认方法涉及使用不同比例的拒绝消息训练多个模型,以实现所需的拒绝率,这在计算上昂贵,且可能需要为每个用户所需的拒绝率偏好训练新模型。为此,我们提出拒绝标记,每类拒绝类别或单个拒绝标记一个,作为训练时模型响应前缀。我们随后展示了如何在推理期间增加或减少生成该拒绝标记的概率,以引导模型的拒绝行为。拒绝标记可在无需进一步微调的情况下控制单个模型的拒绝率,仅通过在生成期间选择性干预即可。

关键词

引用

@article{arxiv.2412.06748,
  title  = {Refusal Tokens: A Simple Way to Calibrate Refusals in Large Language Models},
  author = {Neel Jain and Aditya Shrivastava and Chenyang Zhu and Daben Liu and Alfy Samuel and Ashwinee Panda and Anoop Kumar and Micah Goldblum and Tom Goldstein},
  journal= {arXiv preprint arXiv:2412.06748},
  year   = {2025}
}

备注

20 pages