中文

纠正长尾数据集蒸馏中软标签纠缠偏置

计算机视觉与模式识别 2025-11-25 v1 人工智能

摘要

数据集蒸馏将大规模数据集压缩为紧凑且高度信息丰富的合成数据,显著减少了存储和训练成本。然而,现有研究主要关注平衡数据集,在真实长尾分布下难以实现。本文强调软标签在长尾数据集蒸馏中的关键作用,并揭示了导致性能下降的背后机制。具体而言,我们推导了针对在蒸馏数据集上训练的模型的不平衡感知通用界限。随后,我们通过系统性扰动数据不平衡水平,识别了软标签偏置的两个主要来源,这些来源分别来自蒸馏模型和蒸馏图像。为解决此问题,我们提出了 ADSA(Adaptive Soft-label Alignment,自适应软标签对齐模块),以校准纠缠的偏置。该轻量模块无缝集成到现有蒸馏管道中,并在一致提升性能方面发挥作用。在 ImageNet-1k-LT 上的 EDC 和 IPC=50 实验中,ADSA 将尾部类别准确率提升最高 11.8%,并将整体准确率提升至 41.4%。广泛的实验表明,ADSA 在有限标签预算下以及各种蒸馏技术范围内,提供了稳健且可推广的解决方案。代码已公开:https://github.com/j-cyoung/ADSA_DD.git。

关键词

引用

@article{arxiv.2511.17914,
  title  = {Rectifying Soft-Label Entangled Bias in Long-Tailed Dataset Distillation},
  author = {Chenyang Jiang and Hang Zhao and Xinyu Zhang and Zhengcen Li and Qiben Shan and Shaocong Wu and Jingyong Su},
  journal= {arXiv preprint arXiv:2511.17914},
  year   = {2025}
}

备注

10 pages, accepted by NeurIPS 2025