中文

100K 美元或 100 天:使用学术资源进行预训练的权衡

计算与语言 2025-09-29 v2 机器学习

摘要

预训练一直是一个计算密集型过程,而学术研究人员资源匮乏。因此,人们普遍假设学术界无法进行预训练。本文旨在澄清这一假设。我们首先调查了学术研究人员的可用计算资源,然后经验性地测量了在此类资源上复制模型所需的时间。我们引入了一个衡量给定 GPU 上预训练模型所需时间的基准,并确定在最大化训练速度方面理想的设置。我们在 various models and academic GPUs 上运行该基准,在实验中耗用了 2000 个 GPU 小时。我们的结果揭示了学术预训练的更乐观前景:例如,虽然 Pythia-1B 原始训练在 64 个 GPU 上进行了 3 天,但我们发现也可以在 3 倍更少的 GPU 天数内复制该模型(相同的超参数):即在 4 个 GPU 上进行 18 天。我们以成本效益分析结束,以帮助澄清价格与预训练时间之间的权衡。我们相信本基准将帮助学术研究人员开展需要在更多数据上训练更大模型的实验。我们完全在 https://github.com/apoorvkh/academic-pretraining 上发布了代码。

关键词

引用

@article{arxiv.2410.23261,
  title  = {$100K or 100 Days: Trade-offs when Pre-Training with Academic Resources},
  author = {Apoorv Khandelwal and Tian Yun and Nihal V. Nayak and Jack Merullo and Stephen H. Bach and Chen Sun and Ellie Pavlick},
  journal= {arXiv preprint arXiv:2410.23261},
  year   = {2025}
}

备注

Published at COLM 2025