DD-Ranking:重新思考数据集蒸馏评估方法
计算机视觉与模式识别
2025-09-23 v3
摘要
近年来,数据集蒸馏(dataset distillation)为数据压缩提供了可靠方案,训练于生成的小型合成数据集上的模型可达到与原始数据集相当的性能。为进一步提升合成数据集的性能,人们提出了各种训练流程和优化目标,大幅推动了数据集蒸馏领域的发展。近期出现的解耦式数据集蒸馏方法在后评估阶段引入软标签和更强的数据增强,并将数据集蒸馏扩展至更大规模的数据集(如 ImageNet-1K)。然而,这引发了一个问题:准确率是否仍是公正评估数据集蒸馏方法的可靠指标?我们的实证发现,这些方法的性能提升往往源于额外技术手段,而非图像本身的质量,甚至有随机抽取的图像可获得更优结果。这种误导性的评估环境严重阻碍了 DD 的发展。因此,我们提出 DD-Ranking,一个统一的评估框架,以及新的通用评估指标,以揭示不同方法真正带来的性能提升。通过重新聚焦于蒸馏数据集实际信息增强的效果,DD-Ranking 为未来研究的进步提供了更全面和公正的评估标准。
引用
@article{arxiv.2505.13300,
title = {DD-Ranking: Rethinking the Evaluation of Dataset Distillation},
author = {Zekai Li and Xinhao Zhong and Samir Khaki and Zhiyuan Liang and Yuhao Zhou and Mingjia Shi and Ziqiao Wang and Xuanlei Zhao and Wangbo Zhao and Ziheng Qin and Mengxuan Wu and Pengfei Zhou and Haonan Wang and David Junhao Zhang and Jia-Wei Liu and Shaobo Wang and Dai Liu and Linfeng Zhang and Guang Li and Kun Wang and Zheng Zhu and Zhiheng Ma and Joey Tianyi Zhou and Jiancheng Lv and Yaochu Jin and Peihao Wang and Kaipeng Zhang and Lingjuan Lyu and Yiran Huang and Zeynep Akata and Zhiwei Deng and Xindi Wu and George Cazenavette and Yuzhang Shang and Justin Cui and Jindong Gu and Qian Zheng and Hao Ye and Shuo Wang and Xiaobo Wang and Yan Yan and Angela Yao and Mike Zheng Shou and Tianlong Chen and Hakan Bilen and Baharan Mirzasoleiman and Manolis Kellis and Konstantinos N. Plataniotis and Zhangyang Wang and Bo Zhao and Yang You and Kai Wang},
journal= {arXiv preprint arXiv:2505.13300},
year = {2025}
}
备注
20 pages, 4 figures