机器学习模型规模与参数缺口
机器学习
2022-07-08 v1 人工智能
计算与语言
计算机与社会
摘要
我们使用一个精心整理的数据集,研究了随时间推移著名机器学习系统模型规模的趋势。从1950年到2018年,语言模型的模型规模稳步增长了七个数量级。随后这一趋势加速,从2018年到2022年的短短4年内,模型规模又增加了五个数量级。视觉模型的增长步伐更为恒定,在1950年至2022年间总共增长了七个数量级。我们还发现,自2020年以来,存在许多低于200亿参数的语言模型,也有许多高于700亿参数的模型,但200亿至700亿参数范围内的模型却十分稀缺。我们将这种稀缺性称为参数缺口。我们提供了一些关于参数缺口的典型事实,并提出了一些假设来解释它。我们倾向的解释是:(a) 将模型规模扩大到超过200亿参数需要采用不同的并行技术,这使得中等规模的模型成本效益降低;(b) GPT-3比之前的语言模型大了一个数量级,之后的研究人员主要尝试用更大的模型来超越它。虽然这些动态因素可能存在,并且我们认为它们在产生缺口方面发挥了一定作用,但我们没有足够的信心认为没有其他更重要的动态因素在起作用。
引用
@article{arxiv.2207.02852,
title = {Machine Learning Model Sizes and the Parameter Gap},
author = {Pablo Villalobos and Jaime Sevilla and Tamay Besiroglu and Lennart Heim and Anson Ho and Marius Hobbhahn},
journal= {arXiv preprint arXiv:2207.02852},
year = {2022}
}