大规模数据集的规模高效训练
计算机视觉与模式识别
2025-03-18 v1 人工智能
机器学习
摘要
数据集规模的快速增长是推动深度学习研究发展的关键动力之一。然而,随着数据集规模的增加,由于存在低价值样本(包括过多的冗余样本、过于具有挑战性的样本以及对模型改进贡献有限的低效易样本),训练过程变得越来越不够高效。为解决这一挑战,我们提出了用于大型数据集的 Scale Efficient Training(SeTa),这是一种动态样本修剪方法,可无损地减少训练时间。为去除低价值样本,SeTa 首先进行随机修剪以消除冗余样本,然后根据其通过损失值测量的学习难度对剩余样本进行聚类。基于此聚类,采用滑动窗口策略逐步移除过于具有挑战性和低效易的簇,遵循从易到难的课程。我们在包含超过 300 万样本的大规模人造数据集上进行了广泛实验,包括 ToCa、SS1M 和 ST+MJ。SeTa 在保持或改善性能的同时,将训练成本降低最高可达 50%,即使在 70% 成本降低的情况下也几乎没有性能下降。此外,在各种规模真实数据集上进行的实验,涵盖各种 backbone(CNN、Transformer 和 Mamba)和多样化任务(指令微调、多视图立体、地理定位、组合图像检索、指涉图像分割),证明了我们方法的强大有效性和普适性。代码可在 https://github.com/mrazhou/SeTa 查看。
引用
@article{arxiv.2503.13385,
title = {Scale Efficient Training for Large Datasets},
author = {Qing Zhou and Junyu Gao and Qi Wang},
journal= {arXiv preprint arXiv:2503.13385},
year = {2025}
}
备注
Accepted by CVPR2025