平衡 Adam 的记忆刷新缩放
机器学习
2026-05-13 v2
摘要
近期证据表明,Adam 在其动量参数被绑定时(即 )表现稳健,从而将优化器简化为仅剩单一参数。然而,如何设置该参数仍知之甚少。我们认为,在平衡 Adam 中, 不应被视为无量纲常数:它定义了一个统计记忆视界 。基于从验证轨迹估计的有效学习视界 ,我们研究了刷新计数 ,它衡量了 Adam 在训练的有效阶段内更新其内部统计量的次数。在 11 项视觉和语言实验中,我们发现选择 使得 会根据训练规模选择不同的 值,但相比最佳固定 beta 基线提升了稳健性。与最强的固定选择 相比,刷新规则提升了最坏情况下的稳健性,将验证损失的最大相对差距降低了 33.4%,同时使所有 11 次运行都在其验证预言机(oracle)的 1% 范围内。这些结果表明,平衡 Adam 剩余的超参数更自然地被视为记忆尺度变量,而非固定常数。这为优化器缩放提供了一种简单的预算感知视角,并为将 Adam 的动量作为学习动态的一部分而非静态默认值来处理开辟了道路。
引用
@article{arxiv.2605.10119,
title = {Refresh-Scaling the Memory of Balanced Adam},
author = {Alberto Fernández-Hernández and Cristian Pérez-Corral and Jose I. Mestre and Manuel F. Dolz and Enrique S. Quintana-Ortí},
journal= {arXiv preprint arXiv:2605.10119},
year = {2026}
}