数据蒸馏中的信息性与实用性 grounding 与提升
机器学习
2026-01-30 v1 人工智能
摘要
数据蒸馏 (Dataset Distillation, DD) 旨在从大型真实数据集中创建紧凑数据集。虽然最近的方法常依赖启发式方法来平衡效率与质量,但原始数据与合成数据之间的根本关系仍未得到充分探索。本文在坚实的理论框架下重新审视基于知识蒸馏的数据蒸馏方法。我们引入信息性 (Informativeness) 和实用性 (Utility) 的概念,分别捕捉样本中的关键信息和训练集中关键样本。基于这些原则,我们对最优数据蒸馏进行数学定义。随后,我们提出 InfoUtil 框架,在合成数据集中平衡信息性与实用性。InfoUtil 包含两个关键组件:(1) 基于 Shapley 价值归因的数学博弈信息性最大化,以从样本中提取关键信息;(2) 基于梯度范数选择全球影响样本的原则性实用性最大化。这两个组件确保蒸馏数据集既信息丰富又实用性优化。实验表明,在 ImageNet-1K 数据集上使用 ResNet-18,本方法相比当前最佳方法实现了 6.1% 的性能提升。
引用
@article{arxiv.2601.21296,
title = {Grounding and Enhancing Informativeness and Utility in Dataset Distillation},
author = {Shaobo Wang and Yantai Yang and Guo Chen and Peiru Li and Kaixin Li and Yufa Zhou and Zhaorun Chen and Linfeng Zhang},
journal= {arXiv preprint arXiv:2601.21296},
year = {2026}
}
备注
Accepted by ICLR 2026, 20 pages, 9 figures, 11 tables