中文

Nexus:相同预训练损失,更优下游泛化通过常见极小值

机器学习 2026-05-28 v2

摘要

大型语言模型的基础能力是在针对规模庞大且数据混合性极强的互联网数据的预训练期间获得的。在本工作中,我们调查了一个关于预训练收敛状态的有趣几何问题:模型是否收敛到跨越所有数据源(例如 \cref{fig:cwa_illustration:close})的公共最小化点,抑或仅收敛到求和损失的最小化点(例如 \cref{fig:cwa_illustration:distant})?我们假设任务特定极小值之间的几何"接近性"本质上与下游泛化密切相关。我们揭示标准优化器(如 AdamW)常常收敛到这些极小值彼此相距甚远之处。为此,我们提出了 Nexus 优化器,通过最大化梯度相似性来鼓励这些极小值的接近性。在参数规模从 130 百万到 30 亿不等的模型、各种数据混合方案和超参数计划上进行的实验表明,Nexus \textit{显著提升了下游性能},尽管 \textit{实现了相同的预训练损失}(见 \cref{fig:demo:benchmark)。在 30 亿参数模型上,Nexus 可将分布外损失降低 0.012,并在复杂推理任务(如 GSM8k)上实现最高 15.0\% 的准确率提升。这一发现挑战了仅以预训练损失作为模型评估唯一代理值的做法,展示了隐式偏置在解锁下游泛化中的重要性。

关键词

引用

@article{arxiv.2604.09258,
  title  = {Nexus: Same Pretraining Loss, Better Downstream Generalization via Common Minima},
  author = {Huanran Chen and Huaqing Zhang and Xiao Li and Yinpeng Dong and Ke Shen and Jun Zhu},
  journal= {arXiv preprint arXiv:2604.09258},
  year   = {2026}
}