缩放定律与模型架构:归纳偏置如何影响缩放?
机器学习
2022-07-22 v1 计算与语言
摘要
人们对 Transformer 模型的缩放特性一直抱有浓厚兴趣。然而,在探究不同归纳偏置与模型架构的缩放特性影响方面,所做的工作并不多。模型架构的缩放方式是否不同?若是,归纳偏置如何影响缩放行为?这又如何影响上游(预训练)与下游(迁移)?本文对十种多样模型架构(如 Transformers、Switch Transformers、Universal Transformers、Dynamic convolutions、Performers 以及近期提出的 MLP-Mixers)的缩放行为进行了系统研究。通过大量实验,我们表明:(1) 在执行缩放时,架构确实是一个重要考量因素;(2) 表现最佳的模型在不同规模下可能发生波动。我们认为,本工作所概述的发现对当前社区评估模型架构的方式具有重要启示。
引用
@article{arxiv.2207.10551,
title = {Scaling Laws vs Model Architectures: How does Inductive Bias Influence Scaling?},
author = {Yi Tay and Mostafa Dehghani and Samira Abnar and Hyung Won Chung and William Fedus and Jinfeng Rao and Sharan Narang and Vinh Q. Tran and Dani Yogatama and Donald Metzler},
journal= {arXiv preprint arXiv:2207.10551},
year = {2022}
}