中文

Safe CoR:基于约束奖励的仿照学习与安全强化学习双专家方法

机器人学 2024-07-03 v1 人工智能

摘要

在自主代理领域,确保在复杂动态环境中的安全与可靠性仍是首要挑战。安全强化学习通过引入安全约束来解决这些问题,但在复杂驾驶情境等复杂环境中仍面临挑战。为克服这些挑战,我们提出了安全约束奖励(Safe CoR)框架,一种新方法利用两种专家示范——奖励型专家示范侧重性能优化,安全型专家示范侧重安全性。通过利用约束奖励(CoR),该框架引导智能体在奖励总和的性能目标与安全约束之间取得平衡。我们在多种环境中测试了所提出的框架,包括安全操场、MetaDrive以及真实世界的Jackal平台。我们的方法在真实世界的Jackal平台上使算法性能提升39%,约束违规减少88%,显示该框架的有效性。通过这种创新方法,我们期望在实际应用中实现显著的性能提升,为安全可靠的自主代理领域带来变革性影响。

关键词

引用

@article{arxiv.2407.02245,
  title  = {Safe CoR: A Dual-Expert Approach to Integrating Imitation Learning and Safe Reinforcement Learning Using Constraint Rewards},
  author = {Hyeokjin Kwon and Gunmin Lee and Junseo Lee and Songhwai Oh},
  journal= {arXiv preprint arXiv:2407.02245},
  year   = {2024}
}

备注

Accepted to the Proc. of the IEEE/RSJ International Conference on Intelligent Robots and Systems (IROS), 2024