为何基于规模预测前沿 AI 模型的下游能力仍然困难?
机器学习
2025-02-07 v2 人工智能
计算与语言
摘要
预测高级 AI 系统的规模变化是工程师、经济学家、政府和行业共同期待的属性,尽管已有大量文献阐述了预训练性能如何随规模变化,但关于下游能力预测规模行为的研究仍然尚不完善。尽管诸多因素确实对此负有责任,但本文识别出一个显著因素,使针对广泛使用的多选题答题基准测试进行规模预测变得具有挑战性,并阐明了实现此类下游评估可预测性的路径。我们使用五个模型家族和十二个广泛认可的多选题基准测试,展示下游性能是通过负对数似然性的一系列转换计算得出的,这些转换逐步削弱了性能与规模之间的统计关系。随后,我们指向导致这种退化的机制:下游指标需要将正确选择与少数特定错误选择进行比较,这意味着准确预测下游能力不仅需要预测随规模增长正确选择概率质量的集中程度,还需要预测对错误选择概率质量的波动情况。我们经验性地研究了随计算量增加,正确选择概率质量与错误选择概率质量之间的协变关系,表明针对错误选择的规模规律可能是可实现的。我们的工作也解释了为何预训练规模规律通常被认为比下游能力更可预测,并为建立前沿 AI 模型的规模可预测评估做出了贡献。
引用
@article{arxiv.2406.04391,
title = {Why Has Predicting Downstream Capabilities of Frontier AI Models with Scale Remained Elusive?},
author = {Rylan Schaeffer and Hailey Schoelkopf and Brando Miranda and Gabriel Mukobi and Varun Madan and Adam Ibrahim and Herbie Bradley and Stella Biderman and Sanmi Koyejo},
journal= {arXiv preprint arXiv:2406.04391},
year = {2025}
}