中文

零样本视觉模仿

机器学习 2018-04-24 v1 人工智能 计算机视觉与模式识别 机器人学 机器学习

摘要

当前模仿学习的主导范式依赖对专家动作的强监督以学习模仿的“什么”与“如何”。我们追求一种替代范式:智能体首先在无任何专家监督下探索世界,随后以新颖的前向一致性损失将其经验提炼为以目标为条件的技能策略。在我们的框架中,专家的作用仅在推理时沟通目标(即模仿什么)。所学习策略在仅看到展示所需任务的图像序列后,被用于模仿专家(即如何模仿)。我们的方法是“零样本”的,意指智能体在训练或推理的任务演示中从未接触专家动作。我们在两种真实世界设定中评估零样本模仿器:Baxter 机器人的复杂绳索操控与 TurtleBot 在未见办公室环境中的导航。通过在 VizDoom 仿真中的进一步实验,我们提供证据表明更好的探索机制导致学习到更强能力的策略,进而提升终端任务性能。视频、模型与更多细节见 https://pathak22.github.io/zeroshot-imitation/

关键词

引用

@article{arxiv.1804.08606,
  title  = {Zero-Shot Visual Imitation},
  author = {Deepak Pathak and Parsa Mahmoudieh and Guanghao Luo and Pulkit Agrawal and Dian Chen and Yide Shentu and Evan Shelhamer and Jitendra Malik and Alexei A. Efros and Trevor Darrell},
  journal= {arXiv preprint arXiv:1804.08606},
  year   = {2018}
}

备注

Oral presentation at ICLR 2018. Website at https://pathak22.github.io/zeroshot-imitation/