中文

如可借助在线网络:快速稳定的强化学习

机器学习 2026-05-19 v2

摘要

使用目标网络是深度强化学习中估计价值函数的流行方法。虽然有效,但目标网络仍是一种妥协方案,既保留了稳定性,又使目标移动变慢,从而延迟学习。相反,使用在线网络作为引导目标直观上很有吸引力,尽管众所周知会导致学习不稳定。在本工作中,我们通过引入一种新颖的更新规则来实现两者兼得的目标,即使用目标网络与在线网络之间的最小值估计来计算目标,从而形成我们的方法 MINTO。通过这种简单而有效的修改,我们展示了 MINTO 使价值函数学习更快更稳定,通过减轻使用在线网络进行引导导致的潜在高估偏差。值得注意的是,MINTO 可以无缝集成到各种基于价值的和 actor-critic 算法中,成本可忽略不计。我们在多样化的基准测试中广泛评估了 MINTO,涵盖在线和离线 RL,以及离散和连续动作空间。在所有基准测试中,MINTO 始终提高了性能,显示出其广泛的适用性和有效性。

关键词

引用

@article{arxiv.2510.02590,
  title  = {Use the Online Network If You Can: Towards Fast and Stable Reinforcement Learning},
  author = {Ahmed Hendawy and Henrik Metternich and Théo Vincent and Mahdi Kallel and Jan Peters and Carlo D'Eramo},
  journal= {arXiv preprint arXiv:2510.02590},
  year   = {2026}
}

备注

Accepted at the Fourteenth International Conference on Learning Representations (ICLR 2026)