中文

参数与 FLOPs:混合专家语言模型最优稀疏性的扩展规律

机器学习 2025-07-04 v3 人工智能

摘要

扩大语言模型的容量一直始终证明是提高性能并开启新能力可靠方法。容量主要由两个维度定义:模型参数数量和每个样本的计算量。虽然扩缩放通常涉及同时增加两者,但这些因素及其对整体容量贡献的精确相互作用仍未完全理解。我们在稀疏混合专家(MoE)语境下探讨了这一关系,这类模型允许在不按比例增加每个样本的 FLOPs 的情况下扩展参数数量。我们研究了稀疏度(即非活跃参数比例)的变化如何影响预训练期间及下游few-shot评估中的模型性能。在不同约束下(如参数规模和总训练计算),我们发现存在最优稀疏度可提升训练效率和模型性能。这些结果为更好地理解稀疏性在混合专家扩展规律中的影响,补充了该领域现有研究,为设计更高效架构提供了洞见。

关键词

引用

@article{arxiv.2501.12370,
  title  = {Parameters vs FLOPs: Scaling Laws for Optimal Sparsity for Mixture-of-Experts Language Models},
  author = {Samira Abnar and Harshay Shah and Dan Busbridge and Alaaeldin Mohamed Elnouby Ali and Josh Susskind and Vimal Thilak},
  journal= {arXiv preprint arXiv:2501.12370},
  year   = {2025}
}