重新思考机器学习中的常规智慧:从泛化到规模化
机器学习
2025-02-17 v2 机器学习
摘要
大型语言预训练和规模化定律的突破性成功标志着机器学习的范式转变。值得注意的是,主要目标已从最小化泛化误差转变为减少逼近误差,而最有效的策略也从正则化(广义意义上的正则化)转变为规模化模型。 这提出了一个关键问题:在这个新的规模化时代,那些在泛化主导时代取得成功的既定原则是否仍然有效?本文检验了在规模化主导、大型语言模型(LLM)时代可能不再成立的几个重要正则化原则。这些原则包括显式L2正则化以及通过小批量大小和大学习率实现的隐式正则化。此外,我们还发现了一种新的现象,称为“规模律交叉”,即两个规模曲线在特定规模处交叉,这意味着在较小规模上有效的方法可能无法推广到更大的规模。 这些观察结果凸显了这一新范式中的两个根本问题: 规模化的指导原则:如果正则化不再是模型设计的主要指导原则,那么新的指导原则是什么? 大规模下的模型比较:如何在只能进行单次实验的规模上可靠且有效地进行模型比较?
引用
@article{arxiv.2409.15156,
title = {Rethinking Conventional Wisdom in Machine Learning: From Generalization to Scaling},
author = {Lechao Xiao},
journal= {arXiv preprint arXiv:2409.15156},
year = {2025}
}
备注
25 pages