中文

从贝尔曼最优算子向贝尔曼算子的渐进过渡:在在线强化学习中的应用

机器学习 2025-08-14 v2 人工智能 机器人学

摘要

对于连续动作空间,演器-批评家方法在在线强化学习(RL)中广泛使用。然而,与针对离散动作的RL算法(通常使用贝尔曼最优算子建模最优价值函数)不同,针对连续动作的RL算法通常使用贝尔曼算子来建模当前策略的Q值。这些连续动作算法完全依赖策略更新来实现改进,往往导致样本效率低下。本研究考察了将贝尔曼最优算子纳入演器-批评家框架中的效果。实验在简单环境中表明,建模最优值可加速学习,但会导致高估偏差。为解决此问题,我们提出了一种退火方法,逐渐从贝尔曼最优算子过渡到贝尔曼算子,从而在缓解偏差的同时加速学习。我们的方法结合TD3和SAC, 在各种运动和操控任务上均显著优于现有方法,显示出 improved performance and对与最优性相关的超参数的鲁棒性。本研究的代码已公开于 https://github.com/motokiomura/annealed-q-learning。

关键词

引用

@article{arxiv.2506.05968,
  title  = {Gradual Transition from Bellman Optimality Operator to Bellman Operator in Online Reinforcement Learning},
  author = {Motoki Omura and Kazuki Ota and Takayuki Osa and Yusuke Mukuta and Tatsuya Harada},
  journal= {arXiv preprint arXiv:2506.05968},
  year   = {2025}
}

备注

Accepted at ICML 2025. Source code: https://github.com/motokiomura/annealed-q-learning