自适应预条件器在Adam优化器中触发损失尖峰
信息论
2025-06-06 v1 math.IT
摘要
损失尖峰在使用Adam优化器训练神经网络时常见于各种架构和规模中,然而其背后的机制仍然尚不清晰。虽然先前的解释将其归因于损失较低时损失景观的更锐利,但我们指出,仅凭景观几何学是不足以解释这一现象的。本文指出,其根本原因在于Adam第二时刻估计器的内部动力学。我们识别出一个关键的“解耦”机制,即自适应预条件器 未能跟踪瞬时平方梯度 ,导致自适应机制实际上失效。这种解耦允许预条件器在梯度上升时自行衰减,这会将预条件化Hessian的最大特征值推远离稳定阈值 ,从而在持续一段时间内表现为剧烈的损失尖峰。通过二次近似分析,我们理论和实验地刻画了尖峰演变的五个不同阶段,并提出了一种预测尖峰的方法,基于梯度方向的曲率。我们实验发现,尽管该损失尖峰机制源自简化模型,但其在实际场景中(从小型神经网络到大规模Transformer)的推广性良好。
引用
@article{arxiv.2506.04804,
title = {Spatio-Temporal Information Freshness for Remote Source Monitoring in IoT Systems},
author = {Andrea Munari and Federico Chiariotti and Leonardo Badia and Petar Popovski},
journal= {arXiv preprint arXiv:2506.04804},
year = {2025}
}