训练盈利最优大语言模型的理论
机器学习
2026-05-19 v1 人工智能
摘要
规模化训练大语言模型需要巨大的计算资源,近期的人工智能进展与大量资本支出密切相关。虽然已证实,规模化训练大语言模型可可靠地提高模型质量(以损失或下游评估为度),但这些质量提升如何转化为潜在收益,以及潜在收益是否能抵消大规模训练和推理的成本尚不清楚。本文发展了一种经济模型,用于刻画大语言模型训练公司的理性行为,通过结合规模定律与微观经济学理论。在我们的模型下,随着参数数量和训练标记数的增加,大语言模型质量得以提升,进而增加消费者的潜在采纳率,这些消费者对使用大语言模型都有质量阈值。另一方面,额外的参数和训练标记都会带来额外成本。我们在计算受限和数据受限两种情境下分析该模型的利润最大化问题。在计算受限情境下,最优模型规模和标记预算与硬件效率 (FLOPs/$)呈近线性跟随关系;总体训练成本随 的增大而亚二次增长。数据效率的提升会激励更大的模型规模和训练支出。当受限于数据量 时,利润最优的训练支出规模为 ,即随数据量增加而增加,随硬件效率(以及数据效率)的提升而下降。最后,我们分析了实际的训练支出趋势:当前的趋势在计算受限情境下的最宽容模型变体中表现一致,但在数据受限情境下或假设硬件进步停滞时并不利润最优。总体而言,本文的结果为利润最优的大语言模型训练提供了理论,为批判性地审视行业声明并支持长期经济决策提供了基础。
引用
@article{arxiv.2605.16430,
title = {A Theory of Training Profit-Optimal LLMs},
author = {Sophie Hao and William Merrill},
journal= {arXiv preprint arXiv:2605.16430},
year = {2026}
}