中文

面向目标导向任务的基于计划的松弛奖励塑形

人工智能 2021-07-15 v1 机器学习 机器人学

摘要

在高维状态空间中,强化学习(RL)的实用性受限于探索问题。此前已有工作利用基于势的奖励塑形(PB-RS)来解决该问题。本文中,我们引入终态体积保持奖励塑形(FV-RS)。FV-RS 将 PB-RS 的严格最优性保证松弛为长期行为保持的保证。由于限制更少,FV-RS 允许采用更适于提升 RL 算法样本效率的奖励塑形函数。特别地,我们考虑智能体可获取近似计划的设定。在此,我们以模拟机器人操控任务为例,证明基于计划的 FV-RS 确实能比基于计划的 PB-RS 显著提升 RL 的样本效率。

关键词

引用

@article{arxiv.2107.06661,
  title  = {Plan-Based Relaxed Reward Shaping for Goal-Directed Tasks},
  author = {Ingmar Schubert and Ozgur S. Oguz and Marc Toussaint},
  journal= {arXiv preprint arXiv:2107.06661},
  year   = {2021}
}

备注

Published as a conference paper at ICLR 2021