探究数据集偏差对数据集蒸馏的影响
计算机视觉与模式识别
2024-03-26 v1 机器学习
摘要
数据集蒸馏(DD)是一项颇具前景的技术,用于合成一个保留原始数据集关键信息的更小数据集。该合成数据集可替代原始的大规模数据集,从而有助于减轻训练负担。然而,现有的 DD 方法通常在数据集无偏的假设下运行,忽略了数据集自身潜在的偏差问题。为填补这一空白,我们系统地研究了数据集偏差对 DD 的影响。据我们所知,这是 DD 领域内的首次探索。鉴于目前没有适用于 DD 的有偏数据集,我们首先构建了两个有偏数据集 CMNIST-DD 和 CCIFAR10-DD,以期为后续分析奠定基础。随后,我们利用现有的 DD 方法在 CMNIST-DD 和 CCIFAR10-DD 上生成合成数据集,并按照标准流程评估其性能。实验表明,在大多数情况下,原始数据集中存在的偏差会显著影响合成数据集的性能,这凸显了在 DD 过程中识别并缓解原始数据集中偏差的必要性。最后,我们在有偏数据集的背景下对 DD 进行了重新表述。代码及有偏数据集已发布于 https://github.com/yaolu-zjut/Biased-DD。
引用
@article{arxiv.2403.16028,
title = {Exploring the Impact of Dataset Bias on Dataset Distillation},
author = {Yao Lu and Jianyang Gu and Xuguang Chen and Saeed Vahidian and Qi Xuan},
journal= {arXiv preprint arXiv:2403.16028},
year = {2024}
}