中文

面向抗重学习攻击的 LLM 无学习:从锐度感知最小化视角及其扩展

机器学习 2025-05-28 v4 计算与语言

摘要

LLM 无学习技术最近被引入,以遵循数据法规并解决 LLM 的安全与伦理关切,通过移除不必要的数据-模型影响。然而,现有无学习方法面临一个关键漏洞:它们对已知为重学习攻击的少量忘记数据点极其敏感。本文系统性地研究如何使无学习模型对此类攻击具有鲁棒性。首次,我们通过统一的鲁棒优化框架,将鲁棒无学习与锐度感知最小化 (SAM) 建立联系,这类似于为对抗攻击设计的对抗训练。我们的分析表明,平滑性优化在缓解重学习攻击方面起着关键作用。因此,我们进一步探索多种平滑策略以增强无学习的鲁棒性。在包括 WMDP 和 MUSE 在内的基准数据集上进行的大量实验表明,SAM 以及其他平滑优化方法均一致地提高了 LLM 无学习抗重学习攻击的能力。值得注意的是,平滑增强的无学习还能防御(输入层)越狱攻击,拓宽了本方案在强化 LLM 无学习方面的影响。代码已公开于 https://github.com/OPTML-Group/Unlearn-Smooth。

关键词

引用

@article{arxiv.2502.05374,
  title  = {Towards LLM Unlearning Resilient to Relearning Attacks: A Sharpness-Aware Minimization Perspective and Beyond},
  author = {Chongyu Fan and Jinghan Jia and Yihua Zhang and Anil Ramakrishna and Mingyi Hong and Sijia Liu},
  journal= {arXiv preprint arXiv:2502.05374},
  year   = {2025}
}

备注

Accepted by ICML 2025