中文

高效推理语言模型的规模化

机器学习 2025-06-10 v2 人工智能 计算与语言

摘要

规模化法则是预测大型语言模型性能的强大工具。然而,当前的规模化法则未能充分考虑推理成本。在本工作中,我们首先表明模型架构影响推理延迟,相同规模的模型在延迟上可差异最高达3.5倍。为应对这一挑战,我们修改Chinchilla规模化法则,以协调优化模型参数计数、训练标记数和模型架构。由于相同训练损失的模型在下游评估中存在差异,我们还提出一种基于修订后的规模化法则训练推理高效模型的新方法。我们进行大量实证研究来拟合和评估推理感知规模化法则。我们变更模型参数从80M到1B,训练标记从1.6B到30B,并变更模型结构,训练63个模型。依据我们的推理高效规模化法则和模型选择方法,我们发布了Morph-1B模型,在保持与开源模型在下游任务中准确性的同时,将推理延迟提高了1.8倍,推动了准确性-延迟权衡的Pareto边缘。值得注意的是,我们的实验表明,更宽更浅的模型可以在保持准确性的同时实现效率提升。

关键词

引用

@article{arxiv.2501.18107,
  title  = {Scaling Inference-Efficient Language Models},
  author = {Song Bian and Minghao Yan and Shivaram Venkataraman},
  journal= {arXiv preprint arXiv:2501.18107},
  year   = {2025}
}

备注

21 pages, 18 figures, ICML 2025