深度神经网络的分层权重平均
机器学习
2023-04-25 v1
摘要
尽管简单,随机梯度下降(SGD)类算法在训练深度神经网络(DNNs)方面取得了成功。在众多改进SGD的尝试中,对多个模型权重进行平均的权重平均(WA)近期受到文献广泛关注。广义上,WA分为两类:1)在线WA,对并行训练的多个模型权重进行平均,旨在降低并行小批量SGD的梯度通信开销;2)离线WA,对单个模型在不同检查点的权重进行平均,通常用于提升DNNs的泛化能力。尽管在线与离线WA形式相似,二者却鲜有联系。此外,这些方法通常只进行离线参数平均或在线参数平均,而非二者兼具。本工作中,我们首次尝试将在线与离线WA整合到一个称为分层权重平均(HWA)的通用训练框架中。通过结合在线与离线平均方式,HWA能够在不进行任何复杂学习率调整的情况下,同时实现更快的收敛速度与更优的泛化性能。此外,我们还实证分析了现有WA方法面临的问题以及HWA如何应对这些问题。最后,大量实验验证了HWA显著优于最先进的方法。
引用
@article{arxiv.2304.11519,
title = {Hierarchical Weight Averaging for Deep Neural Networks},
author = {Xiaozhe Gu and Zixun Zhang and Yuncheng Jiang and Tao Luo and Ruimao Zhang and Shuguang Cui and Zhen Li},
journal= {arXiv preprint arXiv:2304.11519},
year = {2023}
}
备注
Accept by TNNLS