中文

多个和核回归范式中的比例律现象

机器学习 2025-03-04 v1 人工智能 机器学习

摘要

最近,大型语言模型(LLMs)取得了显著的成功。其背后的关键因素之一是OpenAI所观察到的比例律。具体而言,对于采用Transformer架构的模型,测试损失与模型规模、数据集规模以及训练所使用的计算量之间呈现幂律关系,显示出超过七个数量级的趋势。这一比例律挑战了传统机器学习智慧,尤其是奥斯卡剪刀原理(Oscar Scissors principle),该原理认为过参数化算法会在训练数据集上产生过拟合,从而导致较差的测试性能。近期研究也在更简单的数字机器学习情境中(如线性回归)识别出比例律。然而,完全解释大型实际模型中的比例律仍是一个难以企及的目标。在本工作中,我们通过表明比例律现象扩展到多个回归和核回归设置中(这些方法显著比线性方法更具表达力和强大能力),来深化对比例律的理解。我们的分析提供了更深入的见解,可能有助于增进对LLMs的理解。

关键词

引用

@article{arxiv.2503.01314,
  title  = {Scaling Law Phenomena Across Regression Paradigms: Multiple and Kernel Approaches},
  author = {Yifang Chen and Xuyang Guo and Xiaoyu Li and Yingyu Liang and Zhenmei Shi and Zhao Song},
  journal= {arXiv preprint arXiv:2503.01314},
  year   = {2025}
}