何时、何处、何时对权重进行平均?
机器学习
2025-11-25 v3
摘要
沿训练轨迹对检查点进行平均是一种简单而强大的技术,可提高机器学习模型的泛化性能并缩短训练时间。受这些潜在收益的启发,为公平且彻底地对准此技术进行基准测试,我们在现代深度学习中对平均技术进行了广泛评估。我们使用 AlgoPerf 对进行了大规模优化算法基准测试。我们研究权重平均是否可以缩短训练时间、提高泛化性能,以及是否可以取代学习率衰减。我们在七个架构和数据集上的评估显示,平均显著加速了训练并产生显著的效率收益,尽管增加了最小的实现和内存开销,同时在所有考虑的工作负载中轻微地提高了泛化性能。最后,我们探讨了平均与学习率退火之间的关系,并展示如何最佳组合这两种技术以获得最佳性能。
引用
@article{arxiv.2502.06761,
title = {When, Where and Why to Average Weights?},
author = {Niccolò Ajroldi and Antonio Orvieto and Jonas Geiping},
journal= {arXiv preprint arXiv:2502.06761},
year = {2025}
}