中文

基于混合梯度的混合离散-连续动作空间策略优化

机器学习 2026-05-15 v1 人工智能 最优化与控制 机器学习

摘要

我们研究混合离散-连续动作空间的强化学习问题,例如离散分量选择一个方案(或指数),连续分量在其中进行优化的设置——这种结构在机器人、控制和运营问题中常见。标准的无模型策略梯度方法依赖于得分函数(SF)估计器,在高维设置下 suffer 从严重的信用分配问题,导致梯度质量差。另一方面,可微仿真大大规避了这些问题,通过对仿真器进行反向传播,但离散动作或非光滑动力学会导致偏置或无信息的梯度。为此,我们提出了混合策略优化(HPO),在光滑性允许的地方对仿真器进行反向传播,使用混合梯度估计器结合路径wise 和 SF 梯度,同时保持无偏性。我们还展示了如何将具有动作不连续性的问题重新表述为混合形式,从而进一步扩大其适用性。实验结果表明,HPO 在库存控制和开关线性-二次调节器问题上显著优于 PPO,随着连续动作维度的增大,性能差距也随之增大。最后,我们描述了混合梯度的结构,显示其交叉项——即连续动作如何影响未来离散决策——在离散最佳响应附近变得可忽略,从而实现对连续和离散分量的近似去中心化更新,减小在最优性附近的方差。所有资源均可在 github.com/MatiasAlvo/hybrid-rl 上获得。

关键词

引用

@article{arxiv.2605.14297,
  title  = {Policy Optimization in Hybrid Discrete-Continuous Action Spaces via Mixed Gradients},
  author = {Matias Alvo and Daniel Russo and Yash Kanoria},
  journal= {arXiv preprint arXiv:2605.14297},
  year   = {2026}
}