中文

通过联合示例选择进行数据整理进一步加速多模态学习

机器学习 2024-06-26 v1 人工智能

摘要

数据整理是大规模预训练的重要组成部分。在这项工作中,我们证明联合选择数据批次比独立选择示例更有利于学习。多模态对比目标暴露了数据之间的依赖性,因此自然地产生了衡量批次联合可学习性的标准。我们推导出一个简单且易于处理的算法来选择此类批次,该算法显著加速了训练,超越了单独优先化的数据点。由于从更大的超级批次中选择可以提高性能,我们还利用模型近似的最新进展来减少相关的计算开销。因此,我们的方法——联合示例选择的多模态对比学习(JEST)——以最多13倍的迭代次数和10倍的计算量超越了最先进的模型。JEST性能的关键在于能够通过预训练的参考模型将数据选择过程引导至更小、精心策划的数据集的分布,从而将数据整理水平暴露为神经缩放定律的一个新维度。

关键词

引用

@article{arxiv.2406.17711,
  title  = {Data curation via joint example selection further accelerates multimodal learning},
  author = {Talfan Evans and Nikhil Parthasarathy and Hamza Merzic and Olivier J. Henaff},
  journal= {arXiv preprint arXiv:2406.17711},
  year   = {2024}
}

备注

Main text: 9 pages, 5 figures, 3 tables, 1 algorithm. Appendix: 7 pages, 5 figures, 1 table, 2. algorithm