面向目标导向任务的基于计划的松弛奖励塑形
人工智能
2021-07-15 v1 机器学习
机器人学
摘要
在高维状态空间中,强化学习(RL)的实用性受限于探索问题。此前已有工作利用基于势的奖励塑形(PB-RS)来解决该问题。本文中,我们引入终态体积保持奖励塑形(FV-RS)。FV-RS 将 PB-RS 的严格最优性保证松弛为长期行为保持的保证。由于限制更少,FV-RS 允许采用更适于提升 RL 算法样本效率的奖励塑形函数。特别地,我们考虑智能体可获取近似计划的设定。在此,我们以模拟机器人操控任务为例,证明基于计划的 FV-RS 确实能比基于计划的 PB-RS 显著提升 RL 的样本效率。
引用
@article{arxiv.2107.06661,
title = {Plan-Based Relaxed Reward Shaping for Goal-Directed Tasks},
author = {Ingmar Schubert and Ozgur S. Oguz and Marc Toussaint},
journal= {arXiv preprint arXiv:2107.06661},
year = {2021}
}
备注
Published as a conference paper at ICLR 2021