中文

具有隐式模型先验的基于到达时间的强化学习奖励

机器人学 2020-10-14 v3

摘要

无模型强化学习 (RL) 是一种直接从高维状态和观测中学习控制策略的强大方法。然而,它往往数据效率低下,这在机器人学习任务中代价尤为高昂。另一方面,如果系统模型已知,最优控制不需要数据,但无法扩展到具有高维状态和观测的模型。为了利用无模型 RL 和最优控制的各自优势,我们提出了基于到达时间的奖励塑形,这是一种受最优控制启发的技术,可缓解数据低效性同时保留无模型 RL 的优势。正如我们的仿真结果所示,这是通过使用 TTR 函数总结关键系统模型信息以极大加速 RL 过程来实现的。TTR 函数定义为在假定的系统动力学约束下,从任意状态移动到目标所需的最短时间。由于 TTR 函数对于具有高维状态的系统在计算上难以处理,我们在仍然能捕捉关键动态行为的近似低维系统模型上对其进行计算。我们的方法可以灵活且轻松地并入任何无模型 RL 算法,而不改变原始算法结构,并且与任何其他可能促进 RL 过程的技术兼容。我们在两个具有代表性的机器人学习任务和三个著名的无模型 RL 算法上评估了我们的方法,并展示了数据效率和性能的显著提升。

关键词

引用

@article{arxiv.1903.09762,
  title  = {TTR-Based Reward for Reinforcement Learning with Implicit Model Priors},
  author = {Xubo Lyu and Mo Chen},
  journal= {arXiv preprint arXiv:1903.09762},
  year   = {2020}
}

备注

This is serving as the full version of the paper that is accepted by IEEE / RSJ International Conference on Intelligent Robots and Systems, 2020