SPARKLING:用于宽度渐进学习的信号保留与对称性打破平衡
机器学习
2026-02-03 v1 计算与语言
摘要
渐进学习(PL)通过逐步增加模型规模来减少预训练计算开销。虽然已有大量研究聚焦于深度扩展,但宽度扩展仍严重不足,现有方法也仅限于训练早期阶段。然而,在中期扩展宽度对于最大化计算节省至关重要,但由于严重的训练不稳定性,这仍然是一个巨大的挑战。经验上,我们表明在该阶段进行的天真初始化会破坏激活统计信息,引发损失尖峰,而基于复制的初始化则引入梯度对称性,阻碍特征多样性。为此,我们提出 SPARKLING(balancing {S}ignal {P}reservation {A}nd symmet{R}y brea{K}ing for width-progressive {L}earn{ING}),一种用于中期宽度扩展的新型框架。我们的 method 通过 RMS 规模一致性实现信号保留,稳定了扩展期间的激活统计。通过非对称优化器状态重置和学习率重新预热来确保对称性打破。在 Mixture-of-Experts(MoE)模型上进行大量实验,结果表明在多种宽度轴向和优化器家族下,SPARKLING 均一致优于从头训练的方式,在 宽度扩展情况下可减少最高达 35% 的训练成本。
引用
@article{arxiv.2602.02472,
title = {SPARKLING: Balancing Signal Preservation and Symmetry Breaking for Width-Progressive Learning},
author = {Qifan Yu and Xinyu Ma and Zhijian Zhuo and Minrui Wang and Deyi Liu and Shiyi Zhan and Yiyuan Ma and Liang Xiang and Xingyan Bin and Di He},
journal= {arXiv preprint arXiv:2602.02472},
year = {2026}
}