视频预训练(VPT):通过观看无标签在线视频学习行动
机器学习
2022-06-24 v1 人工智能
摘要
在含噪声的互联网规模数据集上进行预训练,作为一种为文本、图像及其他模态训练具备广泛通用能力模型的技术已被深入研究。然而,对于许多序列决策领域,如机器人、视频游戏与计算机使用,公开可用数据并不包含以同样方式训练行为先验所需的标签。我们通过半监督模仿学习将互联网规模预训练范式扩展至序列决策领域,其中智能体通过观看在线无标签视频学习行动。具体而言,我们展示:借助少量标签数据,我们可训练出足够精确的逆动力学模型,用以标注海量无标签在线数据源——此处为玩家游玩 Minecraft 的在线视频——并由此训练通用行为先验。尽管使用原生人类接口(鼠标与键盘,20Hz),我们展示该行为先验具有非平凡的零样本能力,且可通过模仿学习与强化学习微调至从零开始经强化学习无法学会的困难探索任务。对于许多任务,我们的模型展现出人类水平性能,且我们首次报告了能够制作钻石工具的计算机智能体,这需熟练人类花费逾 20 分钟(24,000 个环境动作)的游戏时间来完成。
引用
@article{arxiv.2206.11795,
title = {Video PreTraining (VPT): Learning to Act by Watching Unlabeled Online Videos},
author = {Bowen Baker and Ilge Akkaya and Peter Zhokhov and Joost Huizinga and Jie Tang and Adrien Ecoffet and Brandon Houghton and Raul Sampedro and Jeff Clune},
journal= {arXiv preprint arXiv:2206.11795},
year = {2022}
}