如何通过规模定律提升神经网络规模?——调查与实用指南
计算与语言
2025-05-28 v3 机器学习
摘要
神经网络规模定律通过揭示模型规模、数据集规模与计算资源之间的可预测关系, revolutionized 大规模 AI 模型的设计与优化。早期研究在模型性能中建立了幂律关系,导致计算最优规模策略。然而,近期研究指出这些规模定律在不同架构、模态和部署情境下存在局限性。稀疏模型、Mixture-of-Experts、检索增强学习和多模态模型常常偏离传统规模模式。此外,规模行为在视觉、强化学习和微调等不同领域也有所不同,凸显需要更细致的方法。本综述综合了超过 50 项研究,考察了规模定律的理论基础、实证发现和实际影响。我们还探讨了关键挑战,包括数据效率、推理规模和架构特定约束,主张针对实际应用制定自适应规模策略。我们指出,尽管规模定律提供了有用的指南,但它们并不总是能在所有架构和训练策略上普遍适用。
引用
@article{arxiv.2502.12051,
title = {How to Upscale Neural Networks with Scaling Law? A Survey and Practical Guidelines},
author = {Ayan Sengupta and Yash Goel and Tanmoy Chakraborty},
journal= {arXiv preprint arXiv:2502.12051},
year = {2025}
}
备注
21 pages, 11 tables, 4 figures