如可借助在线网络:快速稳定的强化学习
机器学习
2026-05-19 v2
摘要
使用目标网络是深度强化学习中估计价值函数的流行方法。虽然有效,但目标网络仍是一种妥协方案,既保留了稳定性,又使目标移动变慢,从而延迟学习。相反,使用在线网络作为引导目标直观上很有吸引力,尽管众所周知会导致学习不稳定。在本工作中,我们通过引入一种新颖的更新规则来实现两者兼得的目标,即使用目标网络与在线网络之间的最小值估计来计算目标,从而形成我们的方法 MINTO。通过这种简单而有效的修改,我们展示了 MINTO 使价值函数学习更快更稳定,通过减轻使用在线网络进行引导导致的潜在高估偏差。值得注意的是,MINTO 可以无缝集成到各种基于价值的和 actor-critic 算法中,成本可忽略不计。我们在多样化的基准测试中广泛评估了 MINTO,涵盖在线和离线 RL,以及离散和连续动作空间。在所有基准测试中,MINTO 始终提高了性能,显示出其广泛的适用性和有效性。
引用
@article{arxiv.2510.02590,
title = {Use the Online Network If You Can: Towards Fast and Stable Reinforcement Learning},
author = {Ahmed Hendawy and Henrik Metternich and Théo Vincent and Mahdi Kallel and Jan Peters and Carlo D'Eramo},
journal= {arXiv preprint arXiv:2510.02590},
year = {2026}
}
备注
Accepted at the Fourteenth International Conference on Learning Representations (ICLR 2026)