数据蒸馏中的偏差缓解
机器学习
2024-07-11 v2 人工智能
计算机视觉与模式识别
摘要
数据蒸馏作为将大型数据集压缩为较小合成数据集的技术,已在促进下游训练任务方面发挥作用。在本文中,我们研究了原始数据集中偏差对数据蒸馏性能的影响。通过对具有颜色、损坏和背景偏差的标准数据集进行全面经验评估,我们发现原始数据集中的颜色和背景偏差将通过蒸馏过程被放大,导致在 distilled 数据集上训练的模型性能显著下降,而损坏偏差则在蒸馏过程中被抑制。为了减少数据蒸馏中的偏差放大,我们引入一种基于核密度估计的样本重加权方案的简单而高效的方法。在多个真实世界和合成数据集上的经验结果表明,所提方法有效。值得注意的是,在偏差冲突比率为 5% 且 IPC 为 50 的 CMNIST 数据集上,我们的方法实现了 91.5% 的测试准确率,而传统方法仅为 23.8%,性能提升 67.7%;而将最先进的去偏方法应用于同一数据集仅达到 53.7% 的准确率。我们的发现突显了在数据蒸馏中处理偏差的重要性,并为缓解该过程中的偏差放大提供了有前景的途径。
引用
@article{arxiv.2406.06609,
title = {Mitigating Bias in Dataset Distillation},
author = {Justin Cui and Ruochen Wang and Yuanhao Xiong and Cho-Jui Hsieh},
journal= {arXiv preprint arXiv:2406.06609},
year = {2024}
}
备注
ICML