通过即时回顾动作提升在线强化学习中的策略利用
机器学习
2026-02-18 v2
摘要
现有的基于价值的在线强化学习 (RL) 算法因探索效果不佳和策略更新延迟而存在策略利用缓慢的问题。为此提出一种称为即时回顾动作 (IRA) 的算法。具体而言,我们提出 Q-表示差异演化 (RDE) 以促进 Q 网络表示学习,使相邻状态-动作对能够获得判别性表示。此外,我们采用显式方法通过启用贪心动作指导 (GAG) 来实现策略约束。这通过回溯历史动作来实现,有效增强了策略更新过程。我们的方法依赖于提供准确的 最近邻动作价值估计,并通过策略约束学习设计一种快速自适应的策略。我们进一步提出即时策略更新 (IPU) 机制,通过系统性增加策略更新频率来增强策略利用。我们进一步发现,IRA 方法在早期训练中的保守性可以缓解基于价值的强化学习中的高估偏差问题。实验结果表明,在八个 MuJoCo 连续控制任务上,IRA 能够显著提高在线 RL 算法的学习效率和最终性能。代码已提供,链接为 https://github.com/2706853499/IRA。
引用
@article{arxiv.2601.19720,
title = {Improving Policy Exploitation in Online Reinforcement Learning with Instant Retrospect Action},
author = {Gong Gao and Weidong Zhao and Xianhui Liu and Ning Jia},
journal= {arXiv preprint arXiv:2601.19720},
year = {2026}
}
备注
13pages 11figures