中文

用于高效数据集浓缩的训练后量化

计算机视觉与模式识别 2026-03-17 v1 人工智能

摘要

数据集浓缩(DC)将大型数据集中的知识蒸馏到更小的数据集中,加速训练并减少存储需求。然而,尽管取得了显著进展,先前方法在通过量化进一步降低存储成本方面基本未加探索。在本文中,我们迈出了探索训练后量化在数据集浓缩中的第一步,证明其在降低存储大小的同时保持表征质量,而无需昂贵的训练成本。然而,我们发现,在极低位宽(例如2位)下,传统量化导致表征质量大幅下降,对在这些数据上训练的网络产生负面影响。为了解决这一问题,我们提出了一种新颖的基于块的训练后量化方法,确保局部量化且信息损失最小。为了减少量化参数的开销,特别是对于小块大小,我们采用感知量化的聚类来识别相似块,随后将它们聚合以实现高效量化。此外,我们引入了一个精炼模块来对齐原始图像与其反量化对应物之间的分布,以补偿量化误差。我们的方法是一个即插即用框架,可应用于各种DC方法生成的合成图像。在CIFAR-10/100、Tiny ImageNet和ImageNet子集等多样化基准上的广泛实验证明,我们的方法在相同存储约束下持续优于先前方法。值得注意的是,我们的方法在极端压缩条件下(例如,DM在IPC=1时从26.0%提升至54.1%)将现有方法的测试准确率几乎翻倍,同时直接操作2位图像而无需额外蒸馏。

关键词

引用

@article{arxiv.2603.13346,
  title  = {Post Training Quantization for Efficient Dataset Condensation},
  author = {Linh-Tam Tran and Sung-Ho Bae},
  journal= {arXiv preprint arXiv:2603.13346},
  year   = {2026}
}

备注

AAAI-2026 (Oral)