重新审视 LARS 在大批量训练神经网络泛化性中的应用
机器学习
2024-08-28 v5 人工智能
摘要
本文在不同设置下使用逐层自适应缩放比率(LARS)探索大批量训练技术,并揭示了若干见解。带有预热的 LARS 算法由于冗余的比率缩放,早期容易陷入尖锐极小点。此外,后一阶段固定的急剧下降限制了深度神经网络有效摆脱早期阶段的尖锐极小点。基于这些发现,我们提出了时间变化 LARS(TVLARS),一种新颖的算法,其以可配置的 sigmoid 类函数替代预热,以在初始阶段实现鲁棒训练。TVLARS 在早期促进梯度探索,超越尖锐优化器,并逐步过渡到 LARS 以在后阶段获得鲁棒性。大量实验表明,TVLARS 在大多数情况下持续优于 LARS 和 LAMB,在分类场景中最高有 2% 的提升。值得注意的是,在所有自监督学习案例中,TVLARS 以最高 10% 的性能提升全面压倒 LARS 和 LAMB。
引用
@article{arxiv.2309.14053,
title = {Revisiting LARS for Large Batch Training Generalization of Neural Networks},
author = {Khoi Do and Duong Nguyen and Hoa Nguyen and Long Tran-Thanh and Nguyen-Hoang Tran and Quoc-Viet Pham},
journal= {arXiv preprint arXiv:2309.14053},
year = {2024}
}