中文

超越锋利最小值:通过反馈引导的多点优化实现稳健的大语言模型遗忘

机器学习 2025-10-01 v3 人工智能

摘要

当前的大语言模型(LLM)遗忘方法面临一个关键安全漏洞,削弱了其根本目的:虽然它们看似成功地移除了敏感或有害知识,但这种“被遗忘”的信息仍然可以通过重学习攻击保持脆弱的可恢复性。我们识别出根本原因在于,常规方法在单个数据点上优化遗忘损失会导致模型参数趋向损失景观中的锋利最小值。在这些不稳定的区域,即使最小参数扰动也会显著改变模型行为。因此,重学习攻击通过仅使用少数微调样本就能导航这些不稳定区域的陡峭梯度,从而迅速恢复原本被抹除的知识。这暴露了 apparent unlearning 与实际知识移除之间严重的韧性差距。为此,我们提出了 StableUN,一个基于反馈引导的双层优化框架,显式寻求更稳定的参数区域,通过邻域感知优化实现此目标。它整合了遗忘反馈——使用对抗性扰动探测参数邻域——与记忆反馈以保持模型实用性,通过梯度投影将两者目标对齐。在 WMDP 和 MUSE 基准测试上的实验表明,我们的方法在抵抗重学习和渗透攻击方面显著优于现有方法,同时保持具竞争力的实用性能。

关键词

引用

@article{arxiv.2509.20230,
  title  = {Beyond Sharp Minima: Robust LLM Unlearning via Feedback-Guided Multi-Point Optimization},
  author = {Wenhan Wu and Zheyuan Liu and Chongyang Gao and Ren Wang and Kaize Ding},
  journal= {arXiv preprint arXiv:2509.20230},
  year   = {2025}
}