中文

WAGLE:面向大语言模型有效且模块化遗忘的策略性权重归因

机器学习 2025-04-15 v2

摘要

在大语言模型(LLM)中实现有效遗忘机制的需求日益迫切,这是由遵守数据法规和促进合乎道德的生成式人工智能实践的必要性所驱动的。尽管人们对LLM遗忘的兴趣日益增长,但现有研究大多集中在设计不同的遗忘方法以提高有效性和效率上。然而,模型权重与LLM遗忘之间的内在关系尚未得到广泛研究。在本文中,我们系统地探讨了模型权重如何与LLM中的遗忘过程相互作用,并设计了权重归因引导的LLM遗忘方法WAGLE,该方法揭示了权重的“影响”与LLM生成中要遗忘和保留的数据的“影响”之间的相互联系。通过在不同类型的遗忘方法和任务中策略性地引导LLM遗忘,WAGLE可以擦除不需要的内容,同时保持原始任务的性能。我们将这种权重归因引导的LLM遗忘方法称为WAGLE,它揭示了权重的“影响”与LLM生成中要遗忘和保留的数据的“影响”之间的相互联系。我们的大量实验表明,WAGLE在各种LLM遗忘方法(如梯度差异和(负)偏好优化)、应用(如虚构遗忘、恶意使用预防和版权信息移除)以及模型(包括Zephyr-7b-beta和Llama2-7b)上提升了遗忘性能。据我们所知,我们的工作提供了第一个用于归因和精确定位增强LLM遗忘的有影响力权重的原则性方法。这与先前缺乏权重归因的方法以及更简单的权重归因技术形成对比。

关键词

引用

@article{arxiv.2410.17509,
  title  = {WAGLE: Strategic Weight Attribution for Effective and Modular Unlearning in Large Language Models},
  author = {Jinghan Jia and Jiancheng Liu and Yihua Zhang and Parikshit Ram and Nathalie Baracaldo and Sijia Liu},
  journal= {arXiv preprint arXiv:2410.17509},
  year   = {2025}
}

备注

NeurIPS'24