ReversedQ:基于经验性在线强化学习中 Q 学习的加速机会
机器学习
2026-05-21 v1
摘要
我们研究有限时段、跨回合固定动力学的马尔可夫决策过程 (MDP) 中的无模型 Q 学习。我们识别出新兴无模型后验抽样工作中的一个核心问题:依赖延迟学习以获得理论保证。特别是,我们识别了三个加速学习的机会——(i) 价值函数更新顺序,(ii) 更新频率,以及 (iii) 价值函数初始化。以 Wang 等人基于 RandomizedQ 的方法为基础,我们展示了这些变更及其各自(以及组合)在多个实证研究中的影响。我们发现,我们的组合修改,称为 ReversedQ,在双向恐怖组合锁 (BDCL) 中将 scaled 平均累积奖励从 9.53% 提升至 78.78%,在链式 MDP 中从 21.76% 提升至 61.81%。
引用
@article{arxiv.2605.20592,
title = {ReversedQ: Opportunities for Faster Q-Learning in Episodic Online Reinforcement Learning},
author = {Sofia R. Miskala-Dinc and Aviva Prins},
journal= {arXiv preprint arXiv:2605.20592},
year = {2026}
}
备注
This paper contains 5 pages and 2 figures. To be presented at the Adaptive and Learning Agents workshop (ALA 2026) at AAMAS 2026