通过观看 YouTube 视频学习驾驶:动作条件对比策略预训练
计算机视觉与模式识别
2022-07-19 v2 机器学习
机器人学
摘要
深度视觉运动策略学习旨在将原始视觉观测映射到动作,在机器人操纵和自动驾驶等控制任务中取得了有前景的结果。然而,它需要大量与训练环境的在线交互,这限制了其现实世界应用。与用于视觉识别的流行无监督特征学习相比,用于视觉运动控制任务的特征预训练很少被探索。在本工作中,我们旨在通过观看数小时的未筛选 YouTube 视频来为驾驶任务预训练策略表示。具体而言,我们用少量标注数据训练一个逆动力学模型,并用它来预测所有 YouTube 视频帧的动作标签。随后开发了一种新的对比策略预训练方法,以从带有伪动作标签的视频帧中学习动作条件特征。实验表明,所得的动作条件特征在下游强化学习和模仿学习任务上取得了显著改进,优于先前无监督学习方法预训练的权重和 ImageNet 预训练权重。代码、模型权重和数据可在 https://metadriverse.github.io/ACO 获取。
引用
@article{arxiv.2204.02393,
title = {Learning to Drive by Watching YouTube Videos: Action-Conditioned Contrastive Policy Pretraining},
author = {Qihang Zhang and Zhenghao Peng and Bolei Zhou},
journal= {arXiv preprint arXiv:2204.02393},
year = {2022}
}
备注
ECCV accepted paper