基于泰勒近似匹配的高效大规模数据提炼框架 Teddy
计算机视觉与模式识别
2024-10-11 v1
摘要
数据提炼或压缩是将大规模数据集压缩成更小的数据集,以实现在实数据上有效泛化的模型训练。针对这一挑战,本文提出了基于泰勒近似匹配的数据提炼框架 Teddy,以处理大规模数据并提升效率。一方面,基于理论分析,我们提出了源自泰勒展开的内存高效近似,将依赖多步骤梯度的原始形式转化为一阶近似。另一方面,与其在每次迭代中反复训练新模型不同,我们揭示了利用预先缓存的弱模型池(可由单个基础模型生成)能同时提升时间效率和性能,尤其在处理大规模数据集时效果显著。大量实验表明,所提出的 Teddy 在 Tiny-ImageNet 和原始大小的 ImageNet-1K 数据集上实现了领先的效率和性能,尤其在性能提升方面领先约 12.8%,同时将运行时间缩短 46.6%。我们的代码将在 https://github.com/Lexie-YU/Teddy 上发布。
引用
@article{arxiv.2410.07579,
title = {Teddy: Efficient Large-Scale Dataset Distillation via Taylor-Approximated Matching},
author = {Ruonan Yu and Songhua Liu and Jingwen Ye and Xinchao Wang},
journal= {arXiv preprint arXiv:2410.07579},
year = {2024}
}
备注
Accepted by ECCV2024