中文

面向大模型的可扩展超参数分布式集成训练与自动学习率探索

机器学习 2026-04-28 v1 人工智能

摘要

使用数据并行随机梯度下降训练大型神经网络时,将 N 个 GPU 副本分配用于计算有效上完全相同的更新——这一做法导致在训练期间完全未探索学习率配置的丰富空间。我们提出了超参数分布式集成训练(HDET),该方法将这些副本重新用于进行同步学习率探索,通信开销极低。HDET 在交替阶段运行:fan-out 阶段副本在结构化、对称分布的学习率下独立训练,随后在 T 步的间隔通过 AllReduce 对所有副本的参数进行平均,以收敛阶段。基于这个集成基盤,我们进一步提出了自动学习率(auto-LR)控制器,将副本间相对训练损失作为绩效信号,通过动量式无梯度 meta 更新将共享基准 schedule 向表现更好的配置移动。该组合方法产生一个自适应学习率 schedule,提高优化质量和泛化能力,无需额外的超参数搜索或训练预算。关键是,该框架超越了学习率:任何不改变模型结构的标量超参数——如 dropout rate、注意力 scale temperature 或 weight-decay coefficient——都可以使用相同的 fan-out/converge 协议在副本间进行探索,副本间损失差异作为零阶 hypergradient 指导搜索方向。HDET 实现为 PyTorch OneCycleLR scheduler 的即插即用替换,无需更改模型架构、优化器或数据管道。

关键词

引用

@article{arxiv.2604.24708,
  title  = {Scalable Hyperparameter-Divergent Ensemble Training with Automatic Learning Rate Exploration for Large Models},
  author = {Hailing Cheng and Tao Huang and Chen Zhu and Antonio Alonso},
  journal= {arXiv preprint arXiv:2604.24708},
  year   = {2026}
}

备注

8 pages, 2 figures