基于视觉输入的离策略模仿学习
机器学习
2021-11-09 v1 计算机视觉与模式识别
摘要
近年来,模仿学习(IL)中利用专家状态的各种成功应用屡见不鲜。然而,另一种IL设定——基于视觉输入的模仿学习(ILfVI),因利用在线视觉资源而在现实中具有更大应用前景,却受限于低数据效率与较差性能,其根源在于采用on-policy学习方式以及高维视觉输入。我们提出OPIfVI(基于视觉输入的离策略模仿,Off-Policy Imitation from Visual Inputs),它由离策略学习方式、数据增强与编码器技术组成,分别应对上述挑战。更具体地,为提升数据效率,OPIfVI以离策略方式进行IL,使采样数据可被多次使用。此外,我们通过谱归一化增强OPIfVI的稳定性,以缓解离策略训练的副作用。我们认为导致ILfVI性能不佳的核心因素是智能体无法从视觉输入中提取有意义特征。因此,OPIfVI采用计算机视觉中的数据增强来辅助训练能从视觉输入中更好提取特征的编码器。此外,设计了针对编码器的梯度反向传播特定结构以稳定编码器训练。最后,我们通过DeepMind Control Suite上的大量实验证明,无论提供视觉演示还是视觉观测,OPIfVI均能达成专家级性能并超越现有基线。
引用
@article{arxiv.2111.04345,
title = {Off-policy Imitation Learning from Visual Inputs},
author = {Zhihao Cheng and Li Shen and Dacheng Tao},
journal= {arXiv preprint arXiv:2111.04345},
year = {2021}
}