基于表示抹除的偏好优化方法去除大语言模型的有害输出
机器学习
2026-03-02 v1
摘要
在网络规模数据上训练的大语言模型(LLM)可能产生有害输出,引发安全部署方面的顾虑。先前的防御措施基于DPO、NPO等算法的应用,虽能降低有害续写的概率,但鲁棒性不足:它们对对抗性提示极其脆弱,且易被基于微调的重新学习攻击所中倒。事实上,研究表明,这些模型修改是表面的:线性探测揭示了有害“方向”仍以表征形式存在。为此,我们提出基于表示抹除的偏好优化(REPO),将去有害化重新表述为词级偏好问题。通过新型目标函数和偏好数据,我们迫使有害续写的表征趋向其良性对应物。我们的机械分析揭示,这种细粒度方法至关重要:与基线方法不同,REPO对刻在毒性编码神经元中产生深层、局部化的修改,同时保持模型的一般实用性。详尽的评估表明,REPO实现了最先进的鲁棒性,成功阻止包括重新学习攻击和增强型GCG越狱在内的高级威胁,而现有的基于表示和输出的方法在此类攻击上均难以奋战。
引用
@article{arxiv.2602.23391,
title = {Detoxifying LLMs via Representation Erasure-Based Preference Optimization},
author = {Nazanin Mohammadi Sepahvand and Eleni Triantafillou and Hugo Larochelle and Doina Precup and Daniel M. Roy and Gintare Karolina Dziugaite},
journal= {arXiv preprint arXiv:2602.23391},
year = {2026}
}