解决语言模型计算最优比例缩放中的差异
计算机视觉与模式识别
2024-06-28 v1 人工智能
摘要
Kaplan 等人和 Hoffmann 等人开发了关于模型规模与计算预算关系的最优规模定律,但这些定律的预测结果差异很大。我们通过在两个数据集(OpenWebText2 和 RefinedWeb)上复现 Kaplan 的规模定律,并确定导致差异的三个因素:最后一层计算成本、预热持续时间以及与规模相关的优化器调优。纠正这些因素后,我们获得了与 Hoffmann 等人(即“Chinchilla”)规模定律的高度一致结果。与 Hoffmann 等人的假设相反,我们发现仔细的学习率衰减对于其规模定律的有效性并非必不可少。作为次要结果,我们推导出最优学习率和批量大小的规模定律,发现对 AdamW 参数的调优在较小批量大小下至关重要。
引用
@article{arxiv.2406.19148,
title = {BackMix: Mitigating Shortcut Learning in Echocardiography with Minimal Supervision},
author = {Kit Mills Bransby and Arian Beqiri and Woo-Jin Cho Kim and Jorge Oliveira and Agisilaos Chartsias and Alberto Gomez},
journal= {arXiv preprint arXiv:2406.19148},
year = {2024}
}
备注
Accepted at MICCAI 2024 (Pre-print)