利用实验室规模资源训练 T5
计算与语言
2022-08-26 v1
摘要
在大型数据集上训练大型神经语言模型需要消耗大量资源与时间。这些要求构成了进入壁垒,使资源较少的研究者无法构建具有竞争力的模型。本文提出了多种技术,使得 (a) 使用 modest 研究实验室可能拥有的资源来训练大型语言模型,以及 (b) 在合理的时间内完成训练成为可能。我们为实践者提供具体建议,并以一个案例研究加以说明:一个面向丹麦语的 T5 模型,这是该语言的第一个此类模型。
引用
@article{arxiv.2208.12097,
title = {Training a T5 Using Lab-sized Resources},
author = {Manuel R. Ciosici and Leon Derczynski},
journal= {arXiv preprint arXiv:2208.12097},
year = {2022}
}