重访语言与视觉中的神经缩放定律
机器学习
2022-11-02 v2 人工智能
摘要
近年来深度学习的显著进展很大程度上由规模上的改进驱动,即更大的模型在更大的数据集上以更长的训练计划进行训练。为从经验上预测规模的好处,我们主张一种基于外推损失而非报告最佳拟合(插值)参数的更严格方法论。然后我们提出一种从学习曲线可靠估计缩放定律参数的方案。我们证明,在包括图像分类、神经机器翻译(NMT)和语言建模以及来自 BIG-Bench 评估基准的任务在内的多个领域的广泛架构族中,它比先前方法外推更准确。最后,我们发布了一个包含 90 个评估任务的基础数据集以促进该领域的研究。
引用
@article{arxiv.2209.06640,
title = {Revisiting Neural Scaling Laws in Language and Vision},
author = {Ibrahim Alabdulmohsin and Behnam Neyshabur and Xiaohua Zhai},
journal= {arXiv preprint arXiv:2209.06640},
year = {2022}
}