中文

大型语言模型开发中是否存在'秘密配方'?

人工智能 2026-05-05 v2 机器学习 综合经济学 经济学

摘要

领先的大型语言模型(LLM)开发者是否拥有专属的'秘密配方',或者 LLM 性能是否仅由计算资源扩张驱动?本文利用 2022-2025 年间发布的 809 个模型的训练与基准数据,估计带有发布日期和开发者固定效应的扩展规律回归模型。我们发现开发者特定的效率优势具有明确证据,但其重要性取决于模型在性能分布中的位置。在前沿,80-90% 的性能差异由更高的训练计算解释,表明规模——而非专有技术——驱动前沿进展。远离前沿时, however, 专有技术和共享的算法进步显著降低了达到固定能力阈值所需的计算资源。一些公司能够系统性地更高效地训练较小模型。令人惊讶的是,我们也发现公司内部模型效率存在显著差异;同一公司训练的两个模型可能在计算效率上相差超过 40 倍。我们还讨论了这些发现对 AI 领导力和能力扩散的影响。

关键词

引用

@article{arxiv.2602.07238,
  title  = {Is there "Secret Sauce'' in Large Language Model Development?},
  author = {Matthias Mertens and Natalia Fischl-Lanzoni and Neil Thompson},
  journal= {arXiv preprint arXiv:2602.07238},
  year   = {2026}
}