面向数据有效蒸馏的信任感知分流方法
计算机视觉与模式识别
2025-02-10 v1
摘要
数据集蒸馏将大型数据集压缩成一个保留基本信息的小型合成子集。现有方法假设所有样本都被完美标注,这限制了它们在错误标签普遍存在的现实世界中的应用。这些错误标注的样本向数据集中引入了不可信信息,从而在数据集蒸馏中误导模型优化。为了解决这个问题,我们提出了一种信任感知分流(TAD)数据集蒸馏方法。我们提出的 TAD 引入了一个迭代的双环优化框架,用于数据有效的蒸馏。具体来说,外环将数据划分为可信空间和不可信空间,将蒸馏重定向到可信样本,以保证蒸馏过程的可靠性。这一步最小化了错误标注样本对数据集蒸馏的影响。内环通过重新校准不可信样本来最大化蒸馏目标,从而将它们转化为有价值的蒸馏样本。这种双环迭代地相互优化和补偿,逐渐扩大可信空间并缩小不可信空间。实验表明,我们的方法在三个具有挑战性的错误标注设置(对称、非对称和真实世界)下,能够显著提升现有数据集蒸馏方法在三个广泛使用的基准(CIFAR10、CIFAR100 和 Tiny ImageNet)上的性能。
引用
@article{arxiv.2502.05027,
title = {Trust-Aware Diversion for Data-Effective Distillation},
author = {Zhuojie Wu and Yanbin Liu and Xin Shen and Xiaofeng Cao and Xin Yu},
journal= {arXiv preprint arXiv:2502.05027},
year = {2025}
}