中文

简单胜出:重新思考大语言模型无学习中的负面偏好优化

计算与语言 2025-10-21 v4 人工智能 机器学习

摘要

本工作研究大语言模型(LLM)无学习问题,即在保持模型实用性的同时删除不必要的数据影响(如版权或有害内容)。尽管无学习需求日益增长,但缺乏技术导向的优化框架。梯度上升(GA)类型方法虽广泛使用,但次优于反向学习过程,未控制优化发散(即偏离预训练状态的偏差),导致过度遗忘和潜在模型崩溃风险。负面偏好优化(NPO)被提出以解决此问题,被视为LLM无学习方法中的一种最先进方案。本文重新审视NPO,识别出另一关键问题:参考模型偏差。该偏差源于使用无学习前模型(即参考模型)来评估无学习成功,这可能损害NPO的有效性。具体而言,导致(a)在不同难度水平的遗忘数据之间分配优化资源不均,(b)在无学习优化早期阶段梯度权重平滑效果不佳。为克服这些挑战,我们提出一种简单且有效的无学习优化框架,称为SimNPO,通过摆脱对参考模型的依赖(从简单偏好优化的角度)显示“简单”对无学习有益。我们通过基于混合马尔可夫链的分析深入阐述了SimNPO的优势。广泛的实验进一步验证了SimNPO在TOFU和MUSE等基准上的有效性,以及其对抗重学习攻击的鲁棒性。代码地址为 https://github.com/OPTML-Group/Unlearn-Simple。

关键词

引用

@article{arxiv.2410.07163,
  title  = {Simplicity Prevails: Rethinking Negative Preference Optimization for LLM Unlearning},
  author = {Chongyu Fan and Jiancheng Liu and Licong Lin and Jinghan Jia and Ruiqi Zhang and Song Mei and Sijia Liu},
  journal= {arXiv preprint arXiv:2410.07163},
  year   = {2025}
}

备注

Accepted by NeurIPS 2025