中文

在紧张学术计算预算下的语言适应:标记器置换有效,纯 bfloat16 足够

计算与语言 2024-08-29 v1 机器学习

摘要

我们研究了在计算预算紧张的情况下对大语言模型进行语言适应的继续预训练:即仅能在平行情况下使用少数 GPU,且受到严格时间限制。我们聚焦于将 Mistral-7B 适用于德语或阿拉伯语,并评估了在此场景下提高效率和效果的多种技术。我们的德语模型在紧张计算预算下进行适应后,表现不如基础 Mistral-7B;而我们的阿拉伯语模型则超过了多个基线,表明对于充分代表化的语言,进行专门化的继续预训练并非总是有益的。我们的主要发现聚焦于训练精度和标记器置换。我们的结果表明,纯 bfloat16 训练是混合精度训练的可行替代方案,而在仅使用少数 GPU 的情况下速度更快。置换标记器以获得更高效的标记化,与原始标记器(已包含一些德语标记)竞争,且德语方面并未显著提升性能。代码和模型权重均可在 GitHub 上获取。

关键词

引用

@article{arxiv.2408.15793,
  title  = {Language Adaptation on a Tight Academic Compute Budget: Tokenizer Swapping Works and Pure bfloat16 Is Enough},
  author = {Konstantin Dobler and Gerard de Melo},
  journal= {arXiv preprint arXiv:2408.15793},
  year   = {2024}
}

备注

WANT@ICML 2024