中文

Adam 下梯度修改的隐藏失效模式及其作为修复的自适应解耦矩路由

原子物理 2026-05-28 v2 计算物理

摘要

许多持续学习方法在上游修改梯度(如投影、惩罚重新缩放、回放混合),而将 Adam 当作中性后端。我们展示这种组合具有隐藏失效模式。在一个高重叠、非自适应的 8 域持续语言模型中,所有共享路由投影基准在接近 vanilla 遗忘(12.5--12.8 vs. 13.2)处崩溃。0.5% 回放缓冲区是最强的共享备选方案,但仍达到 11.6,而固定强度解耦在 14.1 处低于 vanilla。只有自适应解耦路由在 9.4 处保持稳定,超过 vanilla 3.8 个单位。在 16 域流上,其优势于最强的共享路由投影基准增至 4.5--4.8 个单位。该失效在干净基准上几乎不可见。我们通过 Adam 的 second-moment 路径解释:在测试范围内,投影导致 old-direction 有效学习率按 1/(1-alpha) 膨胀,匹配测量值在八个 alpha 值范围内误差不足 8%。相同冲突同时出现在惩罚方法、回放混合以及 7B 规模下的 LoRA 中。我们的修复方案仅将修改后的梯度路由到 first moment,同时保持 magnitude-忠实的 second-moment 统计,并采用重叠感知的自适应强度。这种简单的改变是唯一在方法、优化器和规模上持续避免崩溃的配置。

关键词

引用

@article{arxiv.2604.22406,
  title  = {Near-deterministic loading of optical tweezer arrays via repulsive barricade potentials},
  author = {Archie C. Baldock and Alex J. Matthies and Luke Caldwell and Hannah J. Williams},
  journal= {arXiv preprint arXiv:2604.22406},
  year   = {2026}
}

备注

7 pages, 3 figures