面向具身导航的可迁移元技能无监督强化学习
计算机视觉与模式识别
2020-04-07 v2
摘要
视觉导航是一项仅利用视觉观测、智能训练具身代理以智能导航至目标物体(如电视机)的任务。当前深度强化学习模型的关键挑战在于需要大量训练数据。构建带有目标物体信息标注的充分3D合成环境极其昂贵。本文关注低资源设定下的视觉导航,即仅拥有少量带物体信息标注的训练环境。我们提出一种新颖的无监督强化学习方法,从无任何监督信号的未标注环境中学习可迁移元技能(如绕过障碍、直行)。当提供视觉导航指定奖励后,代理可通过学习高层主策略组合这些元技能,快速适配视觉导航。在AI2-THOR环境中的评估表明,我们的方法在SPL上相对基线显著提升53.34%,进一步定性分析显示我们的方法学到了可迁移的运动基元用于视觉导航。
引用
@article{arxiv.1911.07450,
title = {Unsupervised Reinforcement Learning of Transferable Meta-Skills for Embodied Navigation},
author = {Juncheng Li and Xin Wang and Siliang Tang and Haizhou Shi and Fei Wu and Yueting Zhuang and William Yang Wang},
journal= {arXiv preprint arXiv:1911.07450},
year = {2020}
}