中文

POLICEd RL:学习可证明满足硬约束的闭环机器人控制策略

机器人学 2024-11-06 v3

摘要

在本文中,我们寻求学习一种保证满足状态约束的机器人策略。为鼓励满足约束,现有的RL算法通常依赖受约束马尔可夫决策过程,并通过奖励塑形来阻止约束违反。然而,此类软约束无法提供可验证的安全性保证。为弥补这一空白,我们提出了POLICEd RL,一种明确设计用于在与黑盒环境的闭环中强制执行仿射硬约束的新型RL算法。我们的关键洞察是迫使所学策略在不安全集周围呈仿射形式,并将该仿射区域用作排斥缓冲区以防止轨迹违反约束。我们证明了此类策略的存在性并保证满足约束。我们提出的框架适用于具有连续和离散状态及动作空间的系统,且与RL训练算法的选择无关。我们的结果证明了POLICEd RL在机器人任务中强制执行硬约束的能力,同时显著优于现有方法。

关键词

引用

@article{arxiv.2403.13297,
  title  = {POLICEd RL: Learning Closed-Loop Robot Control Policies with Provable Satisfaction of Hard Constraints},
  author = {Jean-Baptiste Bouvier and Kartik Nagpal and Negar Mehr},
  journal= {arXiv preprint arXiv:2403.13297},
  year   = {2024}
}

备注

Robotics: Science and Systems (RSS) 2024, https://www.roboticsproceedings.org/rss20/p104.html