中文

模型编辑作为DPO的鲁棒去噪变体:以毒性为例

计算与语言 2025-03-04 v5

摘要

最近的 alignment 算法如直接偏好优化(DPO)已被开发用于通过训练大语言模型(LLM)匹配偏好数据所示例的人类行为来提高其安全性。然而,这些方法既计算密集又缺乏可控性和透明性,阻碍了它们的广泛使用。此外,这些基于调优的方法需要大规模偏好数据进行训练,并且容易受到噪声偏好数据的影响。本文介绍了一种无需调优的 alignment 替代方案ProFS(子空间投影滤波器),并在毒性降低的使用案例中展示了其有效性。基于因子分析理论,ProFS是一种样本高效的模型编辑方法,它在模型参数空间中识别毒性子空间,并通过投影掉检测到的子空间来降低模型毒性。毒性子空间通过从语言模型中提取偏好数据嵌入,并从这些嵌入中去除非毒性信息来识别。我们证明ProFS比DPO更样本高效,并且对噪声数据具有更强的鲁棒性。最后,我们尝试通过建立ProFS和DPO之间的理论和经验联系,将基于调优的 alignment 与编辑联系起来,表明ProFS可以解释为单个DPO步骤的去噪版本。

关键词

引用

@article{arxiv.2405.13967,
  title  = {Model Editing as a Robust and Denoised variant of DPO: A Case Study on Toxicity},
  author = {Rheeya Uppaal and Apratim Dey and Yiting He and Yiqiao Zhong and Junjie Hu},
  journal= {arXiv preprint arXiv:2405.13967},
  year   = {2025}
}

备注

Accepted to ICLR 2025