标签平滑改进 LLM 忘卸中的梯度上升
机器学习
2025-10-28 v1 计算与语言
摘要
LLM 忘卸已成为一种有前景的 method,旨在以低成本使模型忘卸危险/不希望的知识,同时尽可能保留模型的实用性。在现有技术中,最直接的方法是对忘卸数据执行梯度上升(Gradient Ascent),从而迫使模型忘卸忘卸数据集。然而,梯度上升存在严重不稳定性,因为它会驱动更新方向向相反方向移动,常常导致模型实用性大幅降低。为解决此问题,我们提出平滑梯度上升(Smoothed Gradient Ascent, SGA)。SGA 将忘卸数据与多个构造的正常数据通过可调的平滑率进行组合。直观地看,这将梯度上升从仅在忘卸数据上学习,扩展到在忘卸数据和正常数据上联合学习,从而实现更稳定的忘卸同时更好地保留模型实用性。在理论上,我们提供了选择最佳平滑率的理论指导。实验上,我们在三个基准测试上评估了 SGA:TOFU、Harry Potter 和 MUSE-NEWS。实验结果表明,SGA 在所有指标上均优于原始梯度上升(Gradient Ascent, GA)方法,并在几个关键指标上在所有基线方法中取得前两名成绩。
引用
@article{arxiv.2510.22376,
title = {Label Smoothing Improves Gradient Ascent in LLM Unlearning},
author = {Zirui Pang and Hao Zheng and Zhijie Deng and Ling Li and Zixin Zhong and Jiaheng Wei},
journal= {arXiv preprint arXiv:2510.22376},
year = {2025}
}