从贝尔曼最优算子向贝尔曼算子的渐进过渡:在在线强化学习中的应用
机器学习
2025-08-14 v2 人工智能
机器人学
摘要
对于连续动作空间,演器-批评家方法在在线强化学习(RL)中广泛使用。然而,与针对离散动作的RL算法(通常使用贝尔曼最优算子建模最优价值函数)不同,针对连续动作的RL算法通常使用贝尔曼算子来建模当前策略的Q值。这些连续动作算法完全依赖策略更新来实现改进,往往导致样本效率低下。本研究考察了将贝尔曼最优算子纳入演器-批评家框架中的效果。实验在简单环境中表明,建模最优值可加速学习,但会导致高估偏差。为解决此问题,我们提出了一种退火方法,逐渐从贝尔曼最优算子过渡到贝尔曼算子,从而在缓解偏差的同时加速学习。我们的方法结合TD3和SAC, 在各种运动和操控任务上均显著优于现有方法,显示出 improved performance and对与最优性相关的超参数的鲁棒性。本研究的代码已公开于 https://github.com/motokiomura/annealed-q-learning。
引用
@article{arxiv.2506.05968,
title = {Gradual Transition from Bellman Optimality Operator to Bellman Operator in Online Reinforcement Learning},
author = {Motoki Omura and Kazuki Ota and Takayuki Osa and Yusuke Mukuta and Tatsuya Harada},
journal= {arXiv preprint arXiv:2506.05968},
year = {2025}
}
备注
Accepted at ICML 2025. Source code: https://github.com/motokiomura/annealed-q-learning