单次高保真模仿:用强化学习训练大规模深度网络
机器学习
2018-10-12 v1 人工智能
计算机视觉与模式识别
机器人学
摘要
人类是高保真模仿的专家——紧密模仿示范,且常一次尝试即可完成。人类利用此能力快速解决任务实例,并引导新任务的学习。在自主智能体中实现这些能力是一个开放问题。本文中,我们引入一种离策 RL 算法(MetaMimic)以缩小这一差距。MetaMimic 可同时学习 (i) 用于高保真单次模仿多种新颖技能的策路,以及 (ii) 使智能体比示范者更高效解决任务的策略。MetaMimic 依赖于将所有经验存入记忆并回放这些经验,通过离策 RL 学习大规模深度神经网络策略的原理。据我们所知,本文引入了现有用于深度 RL 的最大神经网络,并表明在具挑战性的操作任务上实现单次高保真模仿需要更大的网络与归一化。结果还表明,尽管任务奖励稀疏且无法访问示范者动作,两类策略均可从视觉中学习。
引用
@article{arxiv.1810.05017,
title = {One-Shot High-Fidelity Imitation: Training Large-Scale Deep Nets with RL},
author = {Tom Le Paine and Sergio Gómez Colmenarejo and Ziyu Wang and Scott Reed and Yusuf Aytar and Tobias Pfaff and Matt W. Hoffman and Gabriel Barth-Maron and Serkan Cabi and David Budden and Nando de Freitas},
journal= {arXiv preprint arXiv:1810.05017},
year = {2018}
}