打破类屏障:通过类间特征补偿器实现高效数据蒸馏
计算机视觉与模式识别
2025-03-06 v3 机器学习
摘要
数据蒸馏作为一种旨在将大型自然数据集中信息性特征浓缩到紧凑合成形式的技术日益流行。尽管最近的进展不断完善了这一技术,但其性能受制于当前类特定合成范式的瓶颈。在该范式下,合成数据仅为预分配的一个 one-hot 标签优化,导致特征浓缩中隐式出现类屏障。这最终限制了该技术的有效性和效率,如本文的分析所示。为克服这些限制,本文提出类间特征补偿器 (INFER),一种超越当前数据蒸馈方法中广泛使用的类特定数据-标签框架的创新方法。具体而言,INFER 利用通用特征补偿器 (UFC) 来增强跨类的特征集成,使单个 UFC 输入能够生成多个额外合成实例。这显著提高了蒸馏预算的效率。此外,INFER 在蒸馏过程中丰富类间相互作用,从而增强了蒸馆数据的有效性和通用性。通过允许对类似于原始数据集中标签进行线性插值,INFER 精细地优化合成数据并将合成数据集中的软标签大小几乎降至零,树立了蒸馈效率和效果的新基准。在实际中,INFER 在基准数据集上表现出领先水平。例如,在 ipc = 50 设置下使用相同压缩水平的 ImageNet-1k 上,以 ResNet18 为基线,INFER 对 SRe2L 性能提升 34.5%。
引用
@article{arxiv.2408.06927,
title = {Breaking Class Barriers: Efficient Dataset Distillation via Inter-Class Feature Compensator},
author = {Xin Zhang and Jiawei Du and Ping Liu and Joey Tianyi Zhou},
journal= {arXiv preprint arXiv:2408.06927},
year = {2025}
}
备注
Accepted to ICLR 2025