中文

混合TD3:过估计偏差分析与针对混合动作空间的稳定策略优化

机器人学 2026-03-03 v1

摘要

在离散-连续混合动作空间中进行强化学习为机器人操作臂的操控提出了根本性挑战,必须联合优化高层任务决策与低层关节空间执行。现有方法要么离散化连续分量,要么将离散选择松化为连续近似,这些方法在高维动作空间和域随机化下 suffer from 可扩展性限制和训练不稳定。在本文中,我们提出Hybrid TD3,是对Twin Delayed Deep Deterministic Policy Gradient(TD3)的扩展,能够以原则方式自然处理参数化混合动作空间。我们对混合动作环境下的过估计偏差进行严格理论分析,推导了在双Critic架构下的形式界限,并在五种算法变体中建立了完整的偏差排序。基于这一分析,我们引入一种加权裁剪Q学习目标,对离散动作分布进行边际化,从而实现与标准裁剪最小化相当的偏差消除,同时提高策略平滑度。实验结果表明,Hybrid TD3在训练稳定性和与最先进的混合动作基线方面实现了优异的性能。

关键词

引用

@article{arxiv.2603.01302,
  title  = {Hybrid TD3: Overestimation Bias Analysis and Stable Policy Optimization for Hybrid Action Space},
  author = {Thanh-Tuan Tran and Thanh Nguyen Canh and Nak Young Chong and Xiem HoangVan},
  journal= {arXiv preprint arXiv:2603.01302},
  year   = {2026}
}