中文

并非所有记号都值得被遗忘

机器学习 2026-01-01 v2

摘要

大语言模型(LLM)基于大规模文本语料预训练,展现出惊人的类人语言理解、推理和决策能力。然而,它们倾向于记忆不需要的信息,如私人或受版权保护的内容,这引发了显著的隐私和法律关切。遗忘技术已被视为有前景的解决方案,但现有方法面临显著的过度遗忘挑战。这一问题源于它们不区分对忘记 forget samples 中所有记号,导致 model utility 显著下降。为克服这一挑战,我们提出了 Targeted Information Forgetting(TIF)框架,包括 (1) 设计用于区分 forget samples 中不需要词(unwanted words, UW)和通用词(general words, GW)的灵活的目标信息标识器;(2) 一种新的 Targeted Preference Optimization 方法,利用 Logit Preference Loss 以遗忘 UW 相关的不需要信息,利用 Preservation Loss 以保留 GW 中的通用信息,有效提升遗忘过程的效果,同时减轻 utility 降低。在针对 TOFU 和 MUSE 数据集的大量实验表明,提出的 TIF 框架在提升遗忘效果的同时,保持了 model utility 并实现了最先进的结果。

关键词

引用

@article{arxiv.2506.03142,
  title  = {Not All Tokens Are Meant to Be Forgotten},
  author = {Xiangyu Zhou and Yao Qiang and Saleh Zare Zade and Douglas Zytko and Prashant Khanduri and Dongxiao Zhu},
  journal= {arXiv preprint arXiv:2506.03142},
  year   = {2026}
}