Languini Kitchen:支持不同算力规模下语言建模研究的基础设施
机器学习
2023-09-21 v1 计算与语言
摘要
Languini Kitchen 既是一个研究集体,也是一个代码库,旨在使计算资源有限的研究人员能够为语言建模领域做出有意义的贡献。我们引入了一种实验协议,能够基于以加速器小时衡量的等效算力进行模型比较。模型所训练的词元数量由模型的吞吐量和所选算力等级决定。值得注意的是,该方法避免了对影响总参数量或浮点运算次数的关键超参数的限制。在评估方面,我们对一个现有的大型、多样且高质量书籍数据集进行了预处理,其在质量、多样性和文档长度上均超越现有学术基准。在该数据集上,我们根据通过不同算力层级实验估计的经验缩放趋势来比较方法。本工作还提供了两个基线模型:一个源自 GPT-2 架构的前馈模型,以及一个以新型 LSTM 形式呈现、吞吐量提升十倍的循环模型。尽管 GPT 基线在我们所有算力层级上均取得更好的困惑度,我们的 LSTM 基线展现出可预测且更有利的缩放定律。这是由于改进的吞吐量以及需要更少的训练词元即可实现相同的测试困惑度下降。对两个模型缩放定律的外推导致其在约 50,000 加速器小时处相交。我们希望本工作可作为有意义且可复现的语言建模研究的基础。
引用
@article{arxiv.2309.11197,
title = {The Languini Kitchen: Enabling Language Modelling Research at Different Scales of Compute},
author = {Aleksandar Stanić and Dylan Ashley and Oleg Serikov and Louis Kirsch and Francesco Faccio and Jürgen Schmidhuber and Thomas Hofmann and Imanol Schlag},
journal= {arXiv preprint arXiv:2309.11197},
year = {2023}
}