无真实状态的强化学习
机器人学
2019-07-16 v2 机器学习
摘要
为执行机器人操作任务,通常需要估计环境的低维状态。然而,设计状态估计器有时较为困难,尤其是在包含可变形物体的环境中。一种替代方案是学习一个端到端策略,将高维传感器输入直接映射到动作。但如果该策略使用强化学习进行训练,那么在没有状态估计器的情况下,很难基于高维观测来指定奖励函数。为应对这一挑战,我们提出了一种用于目标条件强化学习的简单指示奖励函数:仅当机器人的观测与目标目标观测完全匹配时,我们才给予正奖励。我们表明,通过将原始目标用已实现目标重新标记以获得正奖励(Andrychowicz et al., 2017),即便在连续状态空间中也能使用该指示奖励函数进行学习。我们提出了两种利用指示奖励进一步加速收敛的方法:奖励平衡与奖励过滤。我们展示了我们的方法与使用真实状态计算奖励的预言机具有相当的性能。我们表明,我们的方法能够在连续状态空间中执行诸如基于 RGB-D 图像的绳索操作等复杂任务,而无需真实状态的知识。
引用
@article{arxiv.1905.07866,
title = {Reinforcement Learning without Ground-Truth State},
author = {Xingyu Lin and Harjatin Singh Baweja and David Held},
journal= {arXiv preprint arXiv:1905.07866},
year = {2019}
}