基于自回归奖励引导的表示编辑消除大语言模型有毒内容
计算与语言
2025-10-03 v1
摘要
大型语言模型(LLMs)在 various 任务中展现出惊人的性能,但仍然容易生成有毒内容,亟需消除策略以确保安全可负责任的部署。测试时消除方法通常在语言模型表示中引入静态或动态干预,因其灵活性和最小侵入性而呈现潜在解决方案。然而,现有方法常因干预不够精确而受限,主要源于其对有毒输出与非有毒输出之间转换空间的探索不足。为此,我们提出了自回归奖励引导表示编辑(Autoregressive Reward Guided Representation Editing, ARGRE)框架,显式建模有毒与非有毒表示之间的转换,实现稳定且精确的奖励引导编辑。ARGRE识别非有毒语义方向,并在有毒与非有毒表示之间进行插值,以揭示细粒度的转换轨迹。这些轨迹将稀疏的有毒注释转化为稠密的训练信号,从而构建自回归奖励模型,提供稳定且精确的编辑指导。在推理时,奖励模型引导自适应的两步编辑过程以获得消除后的表示:首先基于预期奖励差执行方向引导,以将表示导向非有毒区域,随后进行轻量级梯度基的细化。广泛的实验表明,ARGRE在有效性(-62.21% 有毒率)和效率(-47.58% 推理时间)方面显著优于领先的基线方法,同时以最小的性能损失保留原始模型的核心能力。我们的代码已在网站上提供。
引用
@article{arxiv.2510.01243,
title = {Detoxifying Large Language Models via Autoregressive Reward Guided Representation Editing},
author = {Yisong Xiao and Aishan Liu and Siyuan Liang and Zonghao Ying and Xianglong Liu and Dacheng Tao},
journal= {arXiv preprint arXiv:2510.01243},
year = {2025}
}
备注
Accepted to NeurIPS 25