中文

基于变分模型的视觉对抗模仿学习

机器学习 2022-06-29 v2 人工智能 机器人学

摘要

奖励函数设定需要大量人力与反复迭代,仍是通过深度强化学习习得行为的主要障碍。相比之下,提供期望行为的视觉演示往往是一种更简单、更自然的教学智能体的方式。我们考虑如下设定:给智能体一个固定的视觉演示数据集以说明如何执行某项任务,且必须利用所提供的演示与无监督的环境交互来学会解决该任务。该设定带来若干挑战,包括视觉观测的表示学习、高维空间导致的样本复杂度,以及由于缺乏固定奖励或学习信号导致的学习不稳定性。为应对这些挑战,我们提出了一种变分基于模型的对抗模仿学习(V-MAIL)算法。基于模型的方法为表示学习提供了强信号,实现了样本效率,并通过支持同策略学习改善了对抗训练的稳定性。通过在若干基于视觉的运动与操作任务上的实验,我们发现 V-MAIL 以样本高效的方式习得了成功的视觉运动策略,相较先前工作具有更好的稳定性,并且达到了更高的渐近性能。我们进一步发现,通过迁移所学模型,V-MAIL 可从视觉演示中学习新任务而无需任何额外的环境交互。所有结果(包括视频)可在 \url{https://sites.google.com/view/variational-mail} 在线查阅。

关键词

引用

@article{arxiv.2107.08829,
  title  = {Visual Adversarial Imitation Learning using Variational Models},
  author = {Rafael Rafailov and Tianhe Yu and Aravind Rajeswaran and Chelsea Finn},
  journal= {arXiv preprint arXiv:2107.08829},
  year   = {2022}
}