中文

FairDD:公平数据蒸馏

计算机视觉与模式识别 2025-10-14 v2 人工智能 计算机与社会 机器学习

摘要

将大数据集压缩为较小的合成数据集已显示出在图像分类中具有潜力。然而,之前的研究忽视了一个在图像识别中至关重要的 concern:确保在蒸馏数据集上训练的模型对受保护属性(PA,如性别和种族)保持无偏。我们的调查揭示,数据蒸馏未能缓解对原数据集中少数族群的不公平,而且这种偏差通常在数据集较小时会恶化。在研究空白之间搭建桥梁,我们提出了一种新型公平数据蒸馏(FDD)框架,即 FairDD,可以无缝应用于各种基于匹配的蒸馏方法(DDs),无需修改其原始架构。FairDD 的关键创新在于同步地将合成数据集与原数据集按 PA 分组进行匹配,而非对整个分布进行不公平的对齐(由多数族群主导)。这种同步匹配允许合成数据集避免坍缩到多数族群中,并引导其对所有 PA 分组的平衡生成。因此,FairDD 能够有效地正则化传统 DD,以获得对少数族群的偏好生成,同时保持目标属性的准确性。理论分析和大量实验评估表明,FairDD 在公平性方面显著优于传统 DD,在公平性和准确性之间实现了有前景的权衡。其在分布匹配和梯度匹配等多种 DD 上的持久优势确立了其作为通用 FDD 方法的地位。代码可在 https://github.com/zqhang/FairDD 获取。

关键词

引用

@article{arxiv.2411.19623,
  title  = {FairDD: Fair Dataset Distillation},
  author = {Qihang Zhou and Shenhao Fang and Shibo He and Wenchao Meng and Jiming Chen},
  journal= {arXiv preprint arXiv:2411.19623},
  year   = {2025}
}

备注

Accepted by NIPS2025