重思长尾数据蒸馏:面向公平恢复与重标注的统一层次框架
计算机视觉与模式识别
2025-12-16 v2
摘要
数据蒸馏创建小型蒸馏集,以捕获完整数据集中的关键信息,实现高效训练。虽然现有数据蒸馏方法在平衡数据集上表现良好,但在长尾分布下难以胜任,其中不平衡的类频率会导致模型表示偏差,破坏诸如批量归一化(BN)统计等统计估计。在本文中,我们通过重新审视基于轨迹的方法的局限性,转而采用统计对齐视角,联合缓解模型偏差并恢复公平监督。为此,我们引入了三个专门的组件,以实现蒸馏图像的无偏恢复和软重标:(1)增强专家模型(用于恢复的观察者模型和用于重标的教师模型),以实现可靠的统计估计和软标签生成;(2)通过动态调整动量进行的完整前向传播来校准 BN 统计,以减少表示偏斜;(3)通过多轮机制逐步选择高置信度和多样化的数据增强来初始化合成图像,以促进覆盖和多样性。在四个长尾基准数据集上的大量实验表明,我们的方法在不同程度的类不平衡下均优于最先进的方法。值得注意的是,在 IPC=10 且 IF=10 的情况下,我们的方法在 CIFAR-100-LT 上将 Top-1 准确率提升了 15.6%,在 Tiny-ImageNet-LT 上提升了 11.8%。代码已公开于 https://github.com/2018cx/RLDD。
引用
@article{arxiv.2511.18858,
title = {Rethinking Long-tailed Dataset Distillation: A Uni-Level Framework with Unbiased Recovery and Relabeling},
author = {Xiao Cui and Yulei Qin and Xinyue Li and Wengang Zhou and Hongsheng Li and Houqiang Li},
journal= {arXiv preprint arXiv:2511.18858},
year = {2025}
}
备注
AAAI 2026 (Oral)