随机原始对偶 Q 学习
最优化与控制
2025-07-21 v3
摘要
在这项工作中,我们提出一种新的无模型且离策略的强化学习(RL)算法,能够从任意行为策略的状态-动作观测中找到近最优策略。我们的算法称为随机原始对偶 Q 学习(SPD Q-learning),依赖于一种新的线性规划公式以及标准 Q 学习的对偶视角。与先前的原始对偶 RL 算法不同,SPD Q 学习包含一个 Q 函数估计步骤,从而允许从原始解和对偶解中恢复近似策略。我们证明了一种首创的结果:即使状态-动作分布是时变的但次线性地收敛于平稳分布,SPD Q 学习仍保证一定的收敛速率。提供了数值实验以展示所提算法相较于标准 Q 学习的离策略学习能力。
引用
@article{arxiv.1810.08298,
title = {Stochastic Primal-Dual Q-Learning},
author = {Narim Jeong and Donghwan Lee and Niao He},
journal= {arXiv preprint arXiv:1810.08298},
year = {2025}
}