中文

重新思考数据蒸馏:关于软标签的硬事实

机器学习 2026-04-22 v1 计算机视觉与模式识别

摘要

尽管大规模数据蒸馏(DD)方法备受推崇,然而近期证据发现,简单随机图像基线在使用软标签进行下游模型训练时,与像 SRe2L 这样的最先进 DD 方法性能相当。这与核心集文献中的发现相反,在硬标签(HL)设置下,高质量核心集始终优于随机子集。为理解这一差异,本文进行详细的可扩展性分析,考察不同标签体系下数据质量的作用,涵盖从丰富软标签(称为 SL+KD 体系)到固定软标签(SL)以及硬标签(HL)。我们的分析表明,高质量核心集在 SL 和 SL+KD 体系下,均未能明显优于随机基线。在 SL+KD 设置下,无论子集大小或质量如何,性能都接近于相对于完整数据集的近最优水平。这一性能饱和现象质疑了使用软标签进行模型评估的广泛做法,因为在 HL 设置下,子集质量对性能影响微乎其微。随后对五大型和四小型 DD 方法在 HL 设置下的系统评估显示,只有 RDED 在 ImageNet-1K 上可靠地超越随机基线,但仍可能落后于强大的核心集方法,因为其过度依赖于易样本块。基于此,我们引入了 CAD-Prune—a 计算感知的修剪度量标准,高效识别给定计算预算下最优难度样本的集合,并用于开发 CA2D—a 计算对齐的 DD 方法,在 ImageNet-1K 各种 IPC 设置下均超越当前 DD 方法。我们的方法揭示了当前 DD 研究的许多见解,并为面向核心集和 DD 的数据高效学习建立了有用的工具。

关键词

引用

@article{arxiv.2604.18811,
  title  = {Rethinking Dataset Distillation: Hard Truths about Soft Labels},
  author = {Priyam Dey and Aditya Sahdev and Sunny Bhati and Konda Reddy Mopuri and R. Venkatesh Babu},
  journal= {arXiv preprint arXiv:2604.18811},
  year   = {2026}
}

备注

CVPR 2026 (Oral). First two authors contributed equally