中文

面向含硬约束连续控制的约简策略优化

机器学习 2023-12-22 v2

摘要

约束强化学习(RL)的近期进展为强化学习赋予了一定的安全保证。然而,将现有约束 RL 算法部署于带一般硬约束的连续控制任务中仍具挑战性,尤其在非凸硬约束情形下。受广义约简梯度(GRG)算法这一经典约束优化技术启发,我们提出一种约简策略优化(RPO)算法,将 RL 与 GRG 结合以处理一般硬约束。RPO 依 GRG 方法将动作划分为基本动作与非基本动作,并通过策略网络输出基本动作。随后,RPO 利用所得基本动作基于等式约束求解方程算出非基本动作。接着通过对非基本动作关于基本动作隐式微分来更新策略网络。此外,我们引入基于约简梯度的动作投影流程,并应用改进的拉格朗日松弛技术以确保不等式约束得到满足。据我们所知,RPO 首次尝试将 GRG 引入 RL,作为高效处理等式与不等式硬约束的手段。值得注意的是,当前缺乏含复杂硬约束的 RL 环境,这促使我们开发三个新基准:两个机器人操作任务和一个智能电网运行控制任务。借助这些基准,RPO 在累积奖励和约束违反方面均优于以往约束 RL 算法。我们相信 RPO 及新基准将为 RL 应用于含复杂约束的真实世界问题开辟新机遇。

关键词

引用

@article{arxiv.2310.09574,
  title  = {Reduced Policy Optimization for Continuous Control with Hard Constraints},
  author = {Shutong Ding and Jingya Wang and Yali Du and Ye Shi},
  journal= {arXiv preprint arXiv:2310.09574},
  year   = {2023}
}

备注

Accepted by NeurIPS2023