中文

Unilogit:基于均匀目标自蒸馏的大语言模型鲁棒机器遗忘方法

计算与语言 2025-05-12 v1 机器学习

摘要

本文提出 Unilogit,一种用于大语言模型机器遗忘的新型自蒸馏方法。Unilogit 旨在解决选择性遗忘特定信息同时保持模型整体效用的挑战,这是遵守如 GDPR 等数据隐私法规的关键任务。与依赖静态超参数或初始模型输出的先前方法不同,Unilogit 动态调整目标 logits,利用当前模型的输出为更精确的自蒸馏目标,使目标 token 达到均匀概率。该方法不仅消除了对额外超参数的需求,还增强了模型逼近黄金目标的能力。在公开基准测试和一个内部电子商务数据集上的大量实验表明,Unilogit 在平衡遗忘与保留目标方面具有卓越性能,优于 NPO 和 UnDIAL 等最先进方法。我们的分析进一步揭示了 Unilogit 在各种场景下的鲁棒性,突显了其在实现有效机器遗忘方面的实际适用性和有效性。

关键词

引用

@article{arxiv.2505.06027,
  title  = {Unilogit: Robust Machine Unlearning for LLMs Using Uniform-Target Self-Distillation},
  author = {Stefan Vasilev and Christian Herold and Baohao Liao and Seyyed Hadi Hashemi and Shahram Khadivi and Christof Monz},
  journal= {arXiv preprint arXiv:2505.06027},
  year   = {2025}
}

备注

16 pages, 6 figures, 5 tables, under review at ACL