中文

RIDM:用于从单次观测演示学习的强化逆动态建模

机器学习 2020-07-23 v4 机器人学 机器学习

摘要

将强化学习与模仿学习相结合常被视为一种超越从零开始学习的方法。然而,大多数现有的这两种技术集成方法都受制于若干强假设——其中主要是演示者动作信息可用的假设。本文中,我们探究该假设在多大程度上是必要的,引入并评估了强化逆动态建模(RIDM),一种结合观测模仿学习(IfO)与强化学习且无需依赖演示者动作信息的新范式。此外,RIDM仅需单条演示轨迹,并可直接在原始(未增强)状态特征上运行。我们通过实验发现,在若干仿真任务以及真实UR5机械臂任务上,RIDM相较基线方法表现更优。实验视频见https://sites.google.com/view/ridm-reinforced-inverse-dynami。

关键词

引用

@article{arxiv.1906.07372,
  title  = {RIDM: Reinforced Inverse Dynamics Modeling for Learning from a Single Observed Demonstration},
  author = {Brahma S. Pavse and Faraz Torabi and Josiah P. Hanna and Garrett Warnell and Peter Stone},
  journal= {arXiv preprint arXiv:1906.07372},
  year   = {2020}
}

备注

IEEE Robotics and Automation Letters, presented at International Conference on Intelligent Robots and Systems (IROS 2020)