中文

AI进展应以单位资源能力而非规模衡量:面向大语言模型的梯度引导资源分配框架

机器学习 2025-11-04 v1 统计计算

摘要

这篇立场论文挑战了主导AI研究的“规模原教旨主义”,即模型大小和计算量的无限制增长导致了不可持续的环境影响和日益加剧的资源不平等。我们认为,大语言模型的开发应从根本上转向以单位资源能力为导向,而非单纯追求能力。我们提出了一个理论框架,证明由梯度影响模式引导的资源分配决策可以显著提高AI生命周期中的效率。我们的分析表明,在基于Transformer的模型中,一小部分参数发挥着不成比例的巨大影响(遵循重尾分布),由此得出三个关键见解:(1) 在单位性能资源基础上,仅更新高影响参数严格优于全参数微调;(2) 简单的梯度范数可作为识别这些高影响组件的计算高效代理;(3) 协调的参数和数据选择可产生乘数级的效率提升,可能将资源需求降低数个数量级。基于这些理论基础,我们提出了一个两阶段范式:面向基础模型开发者的边际收益预训练,以及面向下游用户的基于影响的适配,两者通过梯度蓝图(描述哪些参数对特定任务最重要的元数据)连接。这种单位资源能力的视角将曾经被视为实用硬件权宜之计的策略转变为理论上的最优策略,在显著减少环境影响的同时,使尖端AI能力的获取更加民主化。通过将资源意识嵌入到我们开发、适配和评估模型的方式中,我们可以将AI进展重塑为更可持续和更公平的未来。

关键词

引用

@article{arxiv.2511.01077,
  title  = {AI Progress Should Be Measured by Capability-Per-Resource, Not Scale Alone: A Framework for Gradient-Guided Resource Allocation in LLMs},
  author = {David McCoy and Yulun Wu and Zachary Butzin-Dozier},
  journal= {arXiv preprint arXiv:2511.01077},
  year   = {2025}
}

备注

9 pages (main) + appendix, 3 figures. Accepted at NeurIPS 2025 (Position Paper Track), submission #491. OpenReview: https://openreview.net/forum?id=6plSmhBI33&noteId=KP5ZqY7JLg