中文

组鲁棒机器学习遗忘

机器学习 2025-12-17 v2 人工智能

摘要

机器学习遗忘是一种新兴范式,旨在从模型中移除特定训练数据(即遗忘集)的影响,同时保留其对其余数据(即保留集)的知识。先前的方法假设遗忘数据在所有训练数据点中均匀分布。然而,如果待遗忘数据在某一群组(如种族、性别)中占主导地位,我们从实证上表明该群组的性能会下降,从而导致公平性问题。为了在执行遗忘的同时保持公平性,本工作研究了被忽视的非均匀分布遗忘集问题,我们称之为组鲁棒机器学习遗忘。我们对该问题进行了形式化,并提出了一种简单而有效的精确遗忘策略,通过样本分布重加权来缓解主导群组的性能损失。此外,我们提出了MIU(基于互信息的机器学习遗忘),这是首个实现组鲁棒性的近似机器学习遗忘方法。MIU最小化模型特征与群组信息之间的互信息,在实现遗忘的同时减少了遗忘集中主导群组的性能退化。此外,MIU利用样本分布重加权以及与原始模型的互信息校准来保持组鲁棒性。我们在三个数据集上进行了实验,结果表明MIU优于标准方法,在不损害模型鲁棒性的前提下实现了遗忘。源代码地址:https://github.com/tdemin16/group-robust_machine_unlearning

关键词

引用

@article{arxiv.2503.09330,
  title  = {Group-robust Machine Unlearning},
  author = {Thomas De Min and Subhankar Roy and Stéphane Lathuilière and Elisa Ricci and Massimiliano Mancini},
  journal= {arXiv preprint arXiv:2503.09330},
  year   = {2025}
}

备注

Published in Transactions on Machine Learning Research (TMLR)