中文

AdamO:抑制崩溃的离线强化学习优化器

机器学习 2026-05-05 v1

摘要

离线强化学习(RL)在 bootstrapped 时序差(TD)更新放大自身误差时会严重失败,导致 critic 趋向极端且无法使用的 Q 值。本文的关键反直觉洞见在于:崩溃不仅是备份规则或网络架构的属性,优化器动力学本身也能直接触发或抑制不稳定性。从控制论视角,我们将离线 TD 学习建模为反馈系统,分析基于 Adam 的 critic 更新。这得到了更新算子谱半径严格小于一时,局部更新动力学稳定性的必要且充分条件。进一步分析表明,标准 Adam 更新不易扭曲参数几何,激励显式正交约束以防止 TD 误差放大。为此,我们提出 AdamO,一种基于 Adam 的优化器,采用解耦的正交校正,由严格的任务对齐预算调节。我们证明,该设计在理论上保证最坏情况任务安全性,保留 Adam 的连续时间耗散动力学。经验上,AdamO 与多样化的离线 RL 基线广泛兼容,跨越广泛基准测试集提升了稳定性和回报。

关键词

引用

@article{arxiv.2605.01968,
  title  = {AdamO: A Collapse-Suppressed Optimizer for Offline RL},
  author = {Nan Qiao and Sheng Yue and Shuning Wang and Ju Ren},
  journal= {arXiv preprint arXiv:2605.01968},
  year   = {2026}
}