中文

逆缩放:当更大并非更好

计算与语言 2024-05-14 v2 人工智能 计算机与社会

摘要

关于缩放定律的研究发现,大语言模型(LMs)随着规模(模型大小、训练数据和计算量)增大,其整体损失会呈现可预测的改善。在此,我们提出证据表明 LMs 可能表现出逆缩放,即随着规模增大任务性能反而变差,例如由于训练目标与数据中的缺陷所致。我们通过运行一项具有丰厚奖金的公开竞赛“逆缩放奖”所收集的 11 个数据集,给出了逆缩放的经验证据。通过对这些数据集以及文献中其他例子的分析,我们识别出逆缩放的四种潜在原因:(i)偏好重复记忆序列而非遵循上下文指令,(ii)模仿训练数据中的不良模式,(iii)任务中包含 LMs 可关注的简单干扰子任务而非更难的真实任务,(iv)任务的正确但具误导性的少样本演示。我们在 https://inversescaling.com/data 发布获奖数据集,以便进一步研究逆缩放。我们的任务有助于发现 U 形和倒 U 形缩放趋势,即初始趋势发生逆转,这表明缩放趋势在预测更大规模模型行为方面不如先前所理解的那样可靠。总体而言,我们的结果表明,存在一些任务,仅增加模型规模本身可能无助于取得进展,并且需要更审慎地考虑语言模型训练的数据与目标。

关键词

引用

@article{arxiv.2306.09479,
  title  = {Inverse Scaling: When Bigger Isn't Better},
  author = {Ian R. McKenzie and Alexander Lyzhov and Michael Pieler and Alicia Parrish and Aaron Mueller and Ameya Prabhu and Euan McLean and Aaron Kirtland and Alexis Ross and Alisa Liu and Andrew Gritsevskiy and Daniel Wurgaft and Derik Kauffman and Gabriel Recchia and Jiacheng Liu and Joe Cavanagh and Max Weiss and Sicong Huang and The Floating Droid and Tom Tseng and Tomasz Korbak and Xudong Shen and Yuhui Zhang and Zhengping Zhou and Najoung Kim and Samuel R. Bowman and Ethan Perez},
  journal= {arXiv preprint arXiv:2306.09479},
  year   = {2024}
}

备注

Published in TMLR (2023), 39 pages