规模定律遇模型架构:面向推理高效大语言模型
机器学习
2026-05-14 v3 人工智能
摘要
通过增加参数数量和训练数据规模可显著提升大语言模型(LLM)性能。然而,随着这些模型日益强大且广泛部署,推理成本已成为迫切关切。尽管此问题重要,但模型准确率与推理效率之间的权衡仍鲜有探讨。本文考察了隐藏层大小、参数在 MLP 与注意力机制之间的分配比例(mlp-to-attention ratio)以及分组查询注意力(GQA)等关键架构因素对推理成本和准确性的影响。我们引入的条件规模定律在Chinchilla框架基础上加入架构信息,并提出了用于识别同时具备推理效率和准确性优势的架构的搜索框架。为验证方法有效性,我们训练了超过200个模型,参数规模从8000万到30亿不等,训练标记从80亿到1000亿不等,并拟合了所提出的条件规模定律。结果表明,条件规模定律可可靠预测最优架构选择,所得模型在准确性上超越现有开源基准。若采用相同训练预算,优化后的架构在准确性上提升最高可达2.1%,推理吞吐量提升42%。
关键词
引用
@article{arxiv.2510.18245,
title = {Scaling Laws Meet Model Architecture: Toward Inference-Efficient LLMs},
author = {Song Bian and Tao Yu and Shivaram Venkataraman and Youngsuk Park},
journal= {arXiv preprint arXiv:2510.18245},
year = {2026}
}
备注
32 pages, 27 figures