中文

IF-GUIDE:影响函数引导的大语言模型去毒

机器学习 2025-12-08 v3 密码学与安全

摘要

我们研究训练数据如何导致大语言模型中出现毒性。先前关于降低模型毒性的工作大多采用被动方法,例如微调预训练(可能含有毒性的)模型以使其与人类价值观对齐。相比之下,我们提出了一种主动方法 IF-GUIDE,利用影响函数识别并抑制训练数据中的有害 token。为此,我们首先表明标准影响函数在发现有害训练记录方面是无效的。然后,我们提出了一种新的自适应方法,用于测量从训练数据到模型毒性的 token 级归因,以及选择有毒训练文档的技术和可集成到预训练和微调中的学习目标。此外,IF-GUIDE 不依赖于现有对齐方法通常需要的人类偏好数据。在评估中,我们证明 IF-GUIDE 显著降低了显式和隐式毒性——与未审查模型相比最多降低 10×\times,与 DPO 和 RAD 等基线对齐方法相比最多降低 3×\times——涵盖预训练和微调场景。IF-GUIDE 计算高效:计算影响分数不需要十亿参数模型;百万参数模型——参数量减少 7.5×\times——即可有效作为识别有害数据的代理。我们的代码公开于:https://github.com/ztcoalson/IF-Guide

关键词

引用

@article{arxiv.2506.01790,
  title  = {IF-GUIDE: Influence Function-Guided Detoxification of LLMs},
  author = {Zachary Coalson and Juhan Bae and Nicholas Carlini and Sanghyun Hong},
  journal= {arXiv preprint arXiv:2506.01790},
  year   = {2025}
}

备注

Accepted at NeurIPS 2025 [Poster]