中文

家族模型比例定律的理论基础

机器学习 2026-01-26 v2 人工智能 计算与语言

摘要

神经网络比例定律已成为大型语言模型 (LLM) 训练的基础,然而它们通常假设单一稠密模型的输出,忽略了 familial 模型这一范式——这一范式对于实现跨异构设备-边缘-云层次结构中普遍智能至关重要。超越静态架构,familial 模型集成了早期退出和继路式推理,从单个共享主干网络生成 G 可部署子模型。本文在引入 Granularity (G) 作为基本缩放变量(除 model size (N) 和 training tokens (D) 之外)后,扩展了比例定律以捕捉此“一次运行,多模型”范式。为严格量化此关系,我们提出统一函数形式 L(N, D, G) 并进行大规模实证拟合。具体而言,我们采用严格的 IsoFLOP 实验设计,以严格隔离架构影响与计算规模的影响。在固定预算下,我们系统性地扫描模型规模 (N) 和细粒度 (G),同时动态调整 token 数 (D)。这种方法有效地将细粒度的边际成本与规模效益解耦,确保了对统一比例定律的高保真参数化。我们的结果表明,细粒度惩罚遵循具有极小指数的乘法幂律。理论而言,这桥接了固定计算训练与动态架构。实际中,这验证了“一次训练,多模型部署”范式,表明可在不牺牲稠密基线计算最优性的前提下实现部署灵活性。

关键词

引用

@article{arxiv.2512.23407,
  title  = {Theoretical Foundations of Scaling Law in Familial Models},
  author = {Huan Song and Qingfei Zhao and Ting Long and Shuyu Tian and Hongjun An and Jiawei Shao and Xuelong Li},
  journal= {arXiv preprint arXiv:2512.23407},
  year   = {2026}
}