中文

NegMerge:面向机器遗忘的符号一致权重合并

机器学习 2025-07-03 v2 人工智能

摘要

机器遗忘旨在从已训练模型中选择性移除特定知识。现有方法(如任务算术)在遗忘集上微调模型以创建任务向量(即权重空间中的一个方向),用于从原始模型权重中减去。然而,其有效性对超参数选择高度敏感,需要大量验证才能从众多微调候选中识别出最优向量。本文提出一种新颖方法,利用所有使用不同超参数训练的微调模型,而非单一选择。具体而言,我们通过仅保留具有一致共享符号的元素来聚合计算出的任务向量。然后对合并后的任务向量取反,以在原始模型上诱导遗忘。在零样本和标准图像识别任务上,跨越十二个数据集和四种骨干架构的评估表明,我们的方法在需要相似或更少计算资源的同时,优于现有最先进方法。代码见 https://github.com/naver-ai/negmerge。

关键词

引用

@article{arxiv.2410.05583,
  title  = {NegMerge: Sign-Consensual Weight Merging for Machine Unlearning},
  author = {Hyo Seo Kim and Dongyoon Han and Junsuk Choe},
  journal= {arXiv preprint arXiv:2410.05583},
  year   = {2025}
}

备注

Accepted to ICML 2025