中文

通过与校准模型的输出层融合对大型语言模型进行去毒

计算与语言 2025-06-03 v1 人工智能

摘要

现有的针对大型语言模型 (LLM) 去毒的方法通常依赖于在大规模无毒或人类标注的偏好数据上进行训练、设计提示以指示 LLM 生成安全内容,或修改模型参数以移除有毒信息,这些方法计算成本高昂、缺乏鲁棒性,且常常损害 LLM 的流畅性和上下文理解能力。在本文中,我们提出了一种简单而有效的 LLM 去毒方法,该方法利用一个紧凑的预训练校准模型,通过在其生成流水线中进行轻量级干预来引导目标 LLM 的去毒过程。通过从无毒数据中学习去毒的嵌入空间,校准模型有效地引导 LLM 远离有害内容的生成。该方法仅需对校准模型进行一次训练,即可无缝应用于多个 LLM,且不损害流畅性或上下文理解能力。在基准数据集上的实验结果表明,我们的方法在降低毒性的同时保持了合理的内容表达。

关键词

引用

@article{arxiv.2506.01266,
  title  = {Detoxification of Large Language Models through Output-layer Fusion with a Calibration Model},
  author = {Yuanhe Tian and Mingjie Deng and Guoqing Jin and Yan Song},
  journal= {arXiv preprint arXiv:2506.01266},
  year   = {2025}
}

备注

5 pages, 1 figure