蒸馏长尾数据集
机器学习
2025-03-20 v2
摘要
数据集蒸馏旨在从大型数据集中合成一个小型、信息丰富的数据集,以实现高效的模型训练。然而,现有的数据集蒸馏方法在处理长尾数据集时存在困难,而长尾数据集在现实场景中普遍存在。通过调查这一意外结果背后的原因,我们确定了两个主要原因:1)在不平衡数据集上的蒸馏过程会产生有偏梯度,导致合成类似不平衡的蒸馏数据集。2)在此类数据集上训练的专家在尾类上表现次优,导致误导性的蒸馏监督和低质量的软标签初始化。为了解决这些问题,我们首先提出了分布无关匹配,以避免直接匹配有偏的专家轨迹。它减少了学生轨迹与有偏专家轨迹之间的距离,并防止尾类偏差被蒸馏到合成数据集中。此外,我们通过专家解耦改进了蒸馏指导,该解耦联合匹配解耦的主干网络和分类器,以提高尾类性能并初始化可靠的软标签。这项工作开创了长尾数据集蒸馏领域,标志着首次有效蒸馏长尾数据集的努力。
引用
@article{arxiv.2408.14506,
title = {Distilling Long-tailed Datasets},
author = {Zhenghao Zhao and Haoxuan Wang and Yuzhang Shang and Kai Wang and Yan Yan},
journal= {arXiv preprint arXiv:2408.14506},
year = {2025}
}
备注
CVPR 2025. Code is available at https://github.com/ichbill/LTDD