VIP:通过价值隐式预训练迈向通用视觉奖励与表征
机器人学
2023-03-08 v2 人工智能
计算机视觉与模式识别
机器学习
摘要
奖励与表征学习是从感官观测中学习不断扩展的机器人操纵技能的两个长期挑战。鉴于领域内、任务特定的机器人数据固有的成本与稀缺性,从大规模、多样化、离线的真人视频中学习已成为为控制获取普遍有用视觉表征的一条有前景的路径;然而,这些真人视频如何用于通用目的的奖励学习仍是一个开放问题。我们引入 alue-mplicit re-training(VIP),一种自监督预训练的视觉表征,能够为未见过的机器人任务生成稠密且平滑的奖励函数。VIP 将来自真人视频的表征学习视为一个离线目标条件强化学习问题,并推导出一个不依赖于动作的自监督对偶目标条件价值函数目标,从而能够在无标签真人视频上预训练。理论上,VIP 可被理解为一种新颖的隐式时间对比目标,其生成时间上平滑的嵌入,使得价值函数可通过嵌入距离隐式定义,进而可用于为任何指定目标图像的下游任务构造奖励。在大规模 Ego4D 真人视频上训练且不对领域内、任务特定数据进行任何微调的情况下,VIP 的冻结表征可为大量模拟与 任务提供稠密视觉奖励,赋能多样的基于奖励的视觉控制方法,并显著优于所有先前的预训练表征。值得注意的是,VIP 能够仅在 20 条轨迹的情况下,在一套真实世界机器人任务上实现简单的 离线 RL。
引用
@article{arxiv.2210.00030,
title = {VIP: Towards Universal Visual Reward and Representation via Value-Implicit Pre-Training},
author = {Yecheng Jason Ma and Shagun Sodhani and Dinesh Jayaraman and Osbert Bastani and Vikash Kumar and Amy Zhang},
journal= {arXiv preprint arXiv:2210.00030},
year = {2023}
}
备注
ICLR 2023, Notable-Top-25% (Spotlight). Project website: https://sites.google.com/view/vip-rl