DPO如何降低毒性?一种机制性的神经元层面分析
机器学习
2025-06-10 v3 计算与语言
摘要
安全微调算法减少了语言模型中的有害输出,但其机制仍未被充分探索。直接偏好优化(DPO)是一种流行的算法,但此前将其效果归因于MLP层中毒性神经元被抑制的解释是不完整的。在本研究中,我们分析了四种语言模型(Llama-3.1-8B、Gemma-2-2B、Mistral-7B、GPT-2-Medium),并表明毒性神经元仅占DPO在各模型中效果的2.5%至24%。相反,DPO通过在所有MLP神经元中平衡分布式的激活偏移来产生净毒性降低。我们将这种降低归因于四个神经元群组,其中两个与降低毒性对齐,两个促进抗毒性,它们的联合效应在各模型中重现了DPO。为了进一步验证这一理解,我们开发了一种激活编辑方法,通过沿毒性表征的分布式偏移来模拟DPO。该方法在降低毒性方面优于DPO,同时保持了困惑度,且无需任何权重更新。我们的工作提供了对DPO的机制性理解,并引入了一种高效的、无需微调的替代安全微调方法。
引用
@article{arxiv.2411.06424,
title = {How Does DPO Reduce Toxicity? A Mechanistic Neuron-Level Analysis},
author = {Yushi Yang and Filip Sondej and Harry Mayne and Andrew Lee and Adam Mahdi},
journal= {arXiv preprint arXiv:2411.06424},
year = {2025}
}