IRIS:基于大规模无交互隐式强化学习从离线机器人操作数据学习控制
机器人学
2020-02-25 v2 人工智能
机器学习
摘要
从离线任务演示中学习是机器人学中备受关注的问题。对于任务实例变化较小、短时程的简单操作任务,从小规模演示集进行离线学习可生成成功解决任务的控制器。然而,对于更大数据集与变化更大的长时程任务,利用固定批次数据可能存在问题。数据可呈现显著多样性并包含次优求解路径。本文中,我们提出大规模无交互隐式强化学习(IRIS),一种从大规模演示数据集学习的新框架。IRIS 将控制问题分解为模仿短演示序列的目标条件低层控制器,以及为低层设定目标并选择性组合次优解各部分以达成更成功任务完成的高层目标选择机制。我们在三个数据集上评估 IRIS,包括由人类通过众包收集的 RoboTurk Cans 数据集,并表明仅从纯离线学习即可学到高性能策略。额外结果见 https://sites.google.com/stanford.edu/iris/ 。
引用
@article{arxiv.1911.05321,
title = {IRIS: Implicit Reinforcement without Interaction at Scale for Learning Control from Offline Robot Manipulation Data},
author = {Ajay Mandlekar and Fabio Ramos and Byron Boots and Silvio Savarese and Li Fei-Fei and Animesh Garg and Dieter Fox},
journal= {arXiv preprint arXiv:1911.05321},
year = {2020}
}