中文

解决语言模型计算最优比例缩放中的差异

计算机视觉与模式识别 2024-06-28 v1 人工智能

摘要

Kaplan 等人和 Hoffmann 等人开发了关于模型规模与计算预算关系的最优规模定律,但这些定律的预测结果差异很大。我们通过在两个数据集(OpenWebText2 和 RefinedWeb)上复现 Kaplan 的规模定律,并确定导致差异的三个因素:最后一层计算成本、预热持续时间以及与规模相关的优化器调优。纠正这些因素后,我们获得了与 Hoffmann 等人(即“Chinchilla”)规模定律的高度一致结果。与 Hoffmann 等人的假设相反,我们发现仔细的学习率衰减对于其规模定律的有效性并非必不可少。作为次要结果,我们推导出最优学习率和批量大小的规模定律,发现对 AdamW β2\beta_2 参数的调优在较小批量大小下至关重要。

关键词

引用

@article{arxiv.2406.19148,
  title  = {BackMix: Mitigating Shortcut Learning in Echocardiography with Minimal Supervision},
  author = {Kit Mills Bransby and Arian Beqiri and Woo-Jin Cho Kim and Jorge Oliveira and Agisilaos Chartsias and Alberto Gomez},
  journal= {arXiv preprint arXiv:2406.19148},
  year   = {2024}
}

备注

Accepted at MICCAI 2024 (Pre-print)