中文

基于任务规约的分层势能奖励塑形

机器学习 2022-10-04 v3 人工智能

摘要

通过强化学习自动合成机器人控制任务的策略,依赖于同时刻画许多可能冲突需求的奖励信号。本文提出一种新颖的、分层的、基于势能的奖励塑形方法(HPRS),用于为这类控制任务的一大类定义有效的多变量奖励。我们将任务形式化为安全、目标和舒适需求的部分有序集合,并定义一种自动化方法以强制需求间的自然顺序并塑形相应奖励。基于势能奖励塑形,我们证明HPRS保持策略最优性。我们的实验评估展示了HPRS在捕捉预期行为上的优越能力,从而收敛出满足任务且提升舒适度的策略,并比其他最先进方法更快收敛到最优行为。我们在多个机器人应用中展示了HPRS的实用性,并在F1TENTH赛车的两个自动驾驶场景上展示了平滑的sim2real迁移。

关键词

引用

@article{arxiv.2110.02792,
  title  = {Hierarchical Potential-based Reward Shaping from Task Specifications},
  author = {Luigi Berducci and Edgar A. Aguilar and Dejan Ničković and Radu Grosu},
  journal= {arXiv preprint arXiv:2110.02792},
  year   = {2022}
}

备注

7 pages main, 5 pages appendix - added f1tenth racing car environment