从自我中心视角视频中学习导航子程序
机器人学
2019-10-16 v2 人工智能
计算机视觉与模式识别
机器学习
摘要
在强化学习中,于更高抽象层级而非低层力矩进行规划可提高样本效率,并在经典规划中提高计算效率。我们提出一种方法,从专家执行任务的自我中心视频数据中学习此类层级抽象,即子程序。我们在少量随机交互数据上学习一个自监督逆模型,以伪标签为专家自我中心视频标注智能体动作。通过训练一个潜在意图条件策略,从这些伪标签视频中预测对应图像观测所推断的伪动作,从而获得视觉运动子程序。我们在导航背景下展示了所提方法,表明我们能够从被动自我中心视频中成功学习到一致且多样的视觉运动子程序。我们通过将所获视觉运动子程序直接用于探索,以及作为分层强化学习框架中用于到达点目标和语义目标的子策略,展示了其实用性。我们还将子程序部署在真实机器人平台上,展示了其在现实世界中的行为。项目网站:https://ashishkumar1993.github.io/subroutines/。
引用
@article{arxiv.1905.12612,
title = {Learning Navigation Subroutines from Egocentric Videos},
author = {Ashish Kumar and Saurabh Gupta and Jitendra Malik},
journal= {arXiv preprint arXiv:1905.12612},
year = {2019}
}