中文

预训练在弱到强泛化中的裨益

机器学习 2026-05-08 v1

摘要

弱到强泛化(W2SG)范式表明,预训练的强模型可以超越其弱监督者,然而预训练的决定性作用在理论和实证上仍未得到充分探索。在这项工作中,我们确定预训练是W2SG出现的必要前提。在理论上,我们使用尖峰高斯数据在高维单指标模型框架内形式化W2SG问题,将预训练建模为谱初始化步骤。基于先前关于随机初始化下学习失败的不可行性结果,我们证明当预训练提供几何热启动,将模型置于以扰动强凸几何为特征的“有效区域”内时,W2SG是可实现的。在该区域内,我们推导出一个严格泛化界,该界自然地捕捉了优化动态:初始性能提升,随后出现由弱监督者偏差决定的饱和瓶颈。在实证上,我们首先通过受控的合成模拟验证了我们所有的假设和理论见解。最后,通过对大型语言模型数百个中间预训练检查点的大规模评估,我们证明W2SG并非天生能力,而是通过与预训练进程紧密耦合的相变而出现的。

关键词

引用

@article{arxiv.2605.05710,
  title  = {On the Blessing of Pre-training in Weak-to-Strong Generalization},
  author = {Wei Yao and Wang Zhaoyang and Gengze Xu and Chen Qian and Dongrui Liu and Ziqiao Wang and Yong Liu and Yunbei Xu},
  journal= {arXiv preprint arXiv:2605.05710},
  year   = {2026}
}

备注

40 pages, 14 figures