中文

基于强化学习求解最小成本到达规避问题

机器学习 2024-10-31 v1 机器人学 最优化与控制

摘要

当前强化学习方法无法直接学习解决最小成本到达规避问题的策略,以最小化累积成本,同时满足到达目标和避免危险状态的约束,因为该新优化问题的结构与当前方法不兼容。相反,解决一个备用问题,其中所有目标通过加权和合并。然而,这一备用目标会导致次优策略,未直接最小化累积成本。本文提出了 RC-PPO 方法,通过与 Hamilton-Jacobi 可达性联系来解决最小成本到达规避问题。实验结果表明,RC-PPO 在 Mujoco 模拟器上的一系列最小成本到达规避基准测试中学习到的策略,目标到达率与现有方法相当,但累积成本降低了最高 57%。项目页面可在 https://oswinso.xyz/rcppo 查找。

关键词

引用

@article{arxiv.2410.22600,
  title  = {Solving Minimum-Cost Reach Avoid using Reinforcement Learning},
  author = {Oswin So and Cheng Ge and Chuchu Fan},
  journal= {arXiv preprint arXiv:2410.22600},
  year   = {2024}
}

备注

Accepted to NeurIPS 2024