中文

更多计算资源才是您所需的

机器学习 2024-05-03 v2 人工智能 计算与语言

摘要

大型语言模型预训练成本日益增加,大多数实践者依赖扩展规律来分配模型规模和训练标记的计算预算,通常称为计算最优或Chinchilla最优。在本文中,我们假设一种新的扩展规律,表明模型性能主要取决于为 transformer-based 模型所花费的计算量,与模型规模和数据集规模的具体分配无关。借助这一统一的扩展规律,我们预测:(a) 对于推理效率,训练应优先考虑较小的模型规模和更大的训练数据集;(b) 假设 web 数据集耗尽,仅通过扩大模型规模可能是进一步提高模型性能的唯一方式。

关键词

引用

@article{arxiv.2404.19484,
  title  = {More Compute Is What You Need},
  author = {Zhen Guo},
  journal= {arXiv preprint arXiv:2404.19484},
  year   = {2024}
}