GRAD-MATCH:基于梯度匹配的数据子集选择以实现高效深度模型训练
机器学习
2021-06-15 v2
摘要
现代机器学习模型在大型数据集上的巨大成功依赖于大量计算资源,并带来高昂的经济与环境成本。一种解决途径是提取能与全量数据泛化性能相当的子集。本文提出通用框架 GRAD-MATCH,其寻找能紧密匹配训练集或验证集梯度的子集。我们使用正交匹配追踪算法高效地找到此类子集。我们给出了所提算法的严格理论与收敛性保证,并通过在真实数据集上的大量实验展示了该框架的有效性。结果表明,GRAD-MATCH 显著且持续地优于若干近期数据选择算法,并取得最佳的精度—效率权衡。GRAD-MATCH 作为 CORDS 工具包的一部分提供:\url{https://github.com/decile-team/cords}。
引用
@article{arxiv.2103.00123,
title = {GRAD-MATCH: Gradient Matching based Data Subset Selection for Efficient Deep Model Training},
author = {Krishnateja Killamsetty and Durga Sivasubramanian and Ganesh Ramakrishnan and Abir De and Rishabh Iyer},
journal= {arXiv preprint arXiv:2103.00123},
year = {2021}
}
备注
To appear in Proceedings of the 38 th International Conference on Machine Learning, PMLR 139, 2021