中文

面向数据蒸馏的数字软标签压缩

计算机视觉与模式识别 2026-03-05 v1

摘要

数据蒸馏是一种新兴技术,通过合成小型信息丰富的数据子集来降低机器学习模型训练的计算和存储成本,该子集能捕捉大型数据集的关键特征。最近的方法将合成样本及其增强样本与教师模型的软标签配对,使学生模型能够在数据规模较小的情况下实现良好的泛化。尽管软标签对有效蒸馏至关重要,但其带来的存储和通信开销往往被忽视。实际情况下,每个蒸馏样本都与多个软标签相关联,使其成为大型类别设置(如 ImageNet-1K)中存储成本的主要贡献者。本文对各种数据蒸馏框架的位数需求进行了严格分析,量化了蒸馏样本及其软标签的存储需求。为解决开销问题,我们引入一种向量量化自编码器 (VQAE) 用于压缩软标签,在保持蒸馏数据有效性的前提下实现了显著压缩。我们在视觉和语言蒸馏基准上验证了该方法。在 ImageNet-1K 上,所提出的 VQAE 相较于 RDED、LPLD、SRE2L 和 CDA 等基线方法实现了 30--40 倍的额外压缩,同时保持了超过 90% 的原始性能。

关键词

引用

@article{arxiv.2603.03808,
  title  = {Vector-Quantized Soft Label Compression for Dataset Distillation},
  author = {Ali Abbasi and Ashkan Shahbazi and Hamed Pirsiavash and Soheil Kolouri},
  journal= {arXiv preprint arXiv:2603.03808},
  year   = {2026}
}