中文

基于机器遗忘的快速模型去偏

机器学习 2023-11-06 v3

摘要

近期研究发现,深度神经网络在许多真实场景中可能表现出偏置行为。例如,在大规模人脸识别数据集 CelebA 上训练的深度网络倾向于将女性预测为金发、男性预测为黑发。此类偏置不仅损害模型的鲁棒性,还延续并放大社会偏见,在医疗、招聘等自动化决策过程中尤为令人担忧,因为它们可能加剧不同群体间不公平的经济与社会不平等。现有去偏方法在偏置标注或模型重训练上成本高昂,且难以阐明模型中偏置的来源。为此,我们提出一种快速模型去偏框架(FMD),为识别、评估和移除训练模型中固有偏置提供了高效途径。FMD 通过显式反事实概念识别偏置属性,并利用影响函数量化数据样本的影响。此外,我们设计了一种基于机器遗忘(machine unlearning)的策略,借助小规模反事实数据集高效且有效地移除训练模型中的偏置。在 Colored MNIST、CelebA 和 Adult Income 数据集以及大语言模型上的实验表明,与 SOTA 方法相比,我们的方法取得了更优或具竞争力的准确率,同时显著减少了偏置并大幅降低了去偏成本。值得注意的是,我们的方法仅需一个小型外部数据集并更新极少量模型参数,无需访问可能因过大或不可用而无法获取的训练数据。

关键词

引用

@article{arxiv.2310.12560,
  title  = {Fast Model Debias with Machine Unlearning},
  author = {Ruizhe Chen and Jianfei Yang and Huimin Xiong and Jianhong Bai and Tianxiang Hu and Jin Hao and Yang Feng and Joey Tianyi Zhou and Jian Wu and Zuozhu Liu},
  journal= {arXiv preprint arXiv:2310.12560},
  year   = {2023}
}