中文

通过非关键区域细化提升数据蒸馏

计算机视觉与模式识别 2025-03-25 v1

摘要

数据蒸馏已成为压缩大数据集为更小、更高效表示 while preserving critical information for model training 的流行方法。数据特征可粗略分为两类:实例特定特征捕获个体示例中独特、精细的细节,类通用特征代表跨类共享的宽泛模式。然而,先前的方法往往难以平衡这些特征——某些仅关注类通用模式,忽略细粒度实例细节;另一些则优先实例特定特征,忽视对类层面理解所必需的共享特征。本文引入非关键区域细化数据蒸馏 (NRR-DD) 方法,在合成数据中保留实例特定细节和精细区域的同时,将类通用信息丰富到非关键区域。该方法使模型能够利用所有像素信息,捕获两种特征类型并提升整体性能。此外,我们提出基于距离的代表 (DBR) 知识传递,该方法通过合成数据预测与 one-hot 编码标签之间的距离来消除对软标签训练的需求。实验结果表明,NRR-DD 在小型和大型数据集上均实现了最佳性能。 Furthermore, by storing only two distances per instance, our method delivers comparable results across various settings. The code is available at https://github.com/tmtuan1307/NRR-DD.

关键词

引用

@article{arxiv.2503.18267,
  title  = {Enhancing Dataset Distillation via Non-Critical Region Refinement},
  author = {Minh-Tuan Tran and Trung Le and Xuan-May Le and Thanh-Toan Do and Dinh Phung},
  journal= {arXiv preprint arXiv:2503.18267},
  year   = {2025}
}

备注

Accepted at CVPR 2025