中文

可训练参数数量是否就是真正重要的全部?

机器学习 2021-09-27 v1 机器学习

摘要

近期工作已识别出语言模型的简单经验缩放律,将计算预算、数据集大小、模型大小与自回归建模损失联系起来。这些简单幂律在模型规模跨越数个数量级时的有效性,提供了令人信服的证据,表明更大的模型也是能力更强的模型。然而,在硬件与基础设施约束下扩展模型绝非易事,并迅速成为困难且昂贵的工程问题。我们研究了一些试探性欺骗缩放律、以更低代价训练更大模型的方法。我们使用高效近似来模拟有效参数的增加:或是通过向模型中掺入冻结的随机参数,或是用快速结构化变换替代稠密线性层。我们发现测试损失与计算量之间的缩放关系仅取决于可训练参数的实际数量;缩放律无法被伪参数所欺骗。

关键词

引用

@article{arxiv.2109.11928,
  title  = {Is the Number of Trainable Parameters All That Actually Matters?},
  author = {Amélie Chatelain and Amine Djeghri and Daniel Hesslow and Julien Launay and Iacopo Poli},
  journal= {arXiv preprint arXiv:2109.11928},
  year   = {2021}
}