中文

基于泰勒近似匹配的高效大规模数据提炼框架 Teddy

计算机视觉与模式识别 2024-10-11 v1

摘要

数据提炼或压缩是将大规模数据集压缩成更小的数据集,以实现在实数据上有效泛化的模型训练。针对这一挑战,本文提出了基于泰勒近似匹配的数据提炼框架 Teddy,以处理大规模数据并提升效率。一方面,基于理论分析,我们提出了源自泰勒展开的内存高效近似,将依赖多步骤梯度的原始形式转化为一阶近似。另一方面,与其在每次迭代中反复训练新模型不同,我们揭示了利用预先缓存的弱模型池(可由单个基础模型生成)能同时提升时间效率和性能,尤其在处理大规模数据集时效果显著。大量实验表明,所提出的 Teddy 在 Tiny-ImageNet 和原始大小的 ImageNet-1K 数据集上实现了领先的效率和性能,尤其在性能提升方面领先约 12.8%,同时将运行时间缩短 46.6%。我们的代码将在 https://github.com/Lexie-YU/Teddy 上发布。

关键词

引用

@article{arxiv.2410.07579,
  title  = {Teddy: Efficient Large-Scale Dataset Distillation via Taylor-Approximated Matching},
  author = {Ruonan Yu and Songhua Liu and Jingwen Ye and Xinchao Wang},
  journal= {arXiv preprint arXiv:2410.07579},
  year   = {2024}
}

备注

Accepted by ECCV2024