通过跨群组重心对齐实现公平数据蒸馏
机器学习
2026-05-22 v2 人工智能
摘要
数据蒸馏旨在将大型数据集压缩为小型合成数据集,同时保持预测性能。我们指出,由于不同人口统计群组呈现出不同的预测模式,蒸馏过程难以同时保留所有子群组的有用信号,无论这些群组的规模是轻度不平衡还是严重不平衡。因此,基于蒸馏数据训练的模型可能在某些子群组上出现显著的性能下降,导致公平性差距。关键在于,这些差距并不会通过仅仅纠正群组不平衡而消失,因为它们源于子群组预测模式之间的根本性不匹配,而不仅仅是样本规模差异。我们因此对这两个来源的偏差进行形式化分析,并将解决方案定义为识别一种不依赖于群组不平衡的重心,使得所有子群组的表征相似。在针对这一共享聚合表征进行蒸馏后,我们证明了可以显著降低公平性 concerns。我们的方法与现有蒸馏方法兼容,实证结果表明,它显著降低了数据蒸馏引入的偏差。代码可在 https://github.com/mhmoslemi/COBRA 上获取。
引用
@article{arxiv.2605.00185,
title = {Fair Dataset Distillation via Cross-Group Barycenter Alignment},
author = {Mohammad Hossein Moslemi and Nima Hosseini Dashtbayaz and Zhimin Mei and Bissan Ghaddar and Boyu Wang},
journal= {arXiv preprint arXiv:2605.00185},
year = {2026}
}
备注
Accepted by ICML 2026