中文

通过探索-开发优化加速大规模数据蒸馏

计算机视觉与模式识别 2026-02-20 v2 人工智能 机器学习

摘要

数据蒸馏将原始数据压缩为紧凑的合成数据集,在保持模型性能的同时减少训练时间和存储需求,使资源受限的情况下得以部署。虽然近期的解耦式数据蒸馏方法使大规模数据蒸馏成为可能,但仍存在效率差距:基于优化的解耦方法虽然实现更高精度,但计算开销巨大;而无优化解耦方法则高效但牺牲精度。为克服这一权衡,本文提出一种简单且实用的探索-开发蒸馏方法(E2^2D),通过高效流程最小化冗余计算。该流程以完全图像初始化开始,保留语义完整性和特征多样性;随后采用两阶段优化策略:探索阶段进行均匀更新并识别高损失区域,开发阶段聚焦这些区域以加速收敛。我们在大规模基准测试上评估了E2^2D,在ImageNet-1K上超越前沿方法,速度提升18倍;在ImageNet-21K上,本方法在保持更快速度(快4.3倍)的同时显著提高精度。这些结果表明,针对性地、减少冗余的更新而非蛮力优化,弥合了大规模数据蒸馏中精度与效率之间的鸿沟。代码已公开于https://github.com/ncsu-dk-lab/E2D。

关键词

引用

@article{arxiv.2602.15277,
  title  = {Accelerating Large-Scale Dataset Distillation via Exploration-Exploitation Optimization},
  author = {Muhammad J. Alahmadi and Peng Gao and Feiyi Wang and Dongkuan Xu},
  journal= {arXiv preprint arXiv:2602.15277},
  year   = {2026}
}