中文

在可学习、值得学习且尚未学会的点上优先训练

机器学习 2022-09-27 v3 人工智能 计算与语言 计算机视觉与模式识别

摘要

在网页规模数据上训练可能需要数月时间。但大部分计算和时间都浪费在已经学会或不可学习的冗余和噪声点上。为了加速训练,我们提出了可约简保留损失选择(RHO-LOSS),这是一种简单但有原则的技术,它大致选择那些最能降低模型泛化损失的点进行训练。因此,RHO-LOSS 缓解了现有数据选择方法的缺陷:来自优化文献的技术通常选择“困难”(如高损失)点,但这类点往往是噪声(不可学习)或与任务相关性较低。相反,课程学习优先“简单”点,但这类点一旦学会就无需再训练。相比之下,RHO-LOSS 选择可学习、值得学习且尚未学会的点。RHO-LOSS 所需的训练步数远少于先前方法,提高了准确率,并在广泛的数据集、超参数和架构(MLP、CNN 和 BERT)上加速了训练。在大型网络抓取图像数据集 Clothing-1M 上,RHO-LOSS 的训练步数减少了 18 倍,且最终准确率比均匀数据洗牌高出 2%。

关键词

引用

@article{arxiv.2206.07137,
  title  = {Prioritized Training on Points that are Learnable, Worth Learning, and Not Yet Learnt},
  author = {Sören Mindermann and Jan Brauner and Muhammed Razzak and Mrinank Sharma and Andreas Kirsch and Winnie Xu and Benedikt Höltgen and Aidan N. Gomez and Adrien Morisot and Sebastian Farquhar and Yarin Gal},
  journal= {arXiv preprint arXiv:2206.07137},
  year   = {2022}
}

备注

ICML 2022