作为强化学习奖励的视频预测模型
机器学习
2023-05-31 v2 人工智能
计算机视觉与模式识别
摘要
为智能体指定能够学习复杂行为的奖励信号是强化学习中长期存在的挑战。一种有前景的方法是从互联网上广泛可用的无标签视频中提取行为偏好。我们提出 Video Prediction Rewards(VIPER),一种利用预训练视频预测模型作为强化学习无动作奖励信号的算法。具体而言,我们首先在专家视频上训练自回归 transformer,然后将视频预测似然作为强化学习智能体的奖励信号。VIPER 在广泛的 DMC、Atari 和 RLBench 任务中无需程序化任务奖励即可实现专家级控制。此外,视频预测模型的泛化能力使我们能为无专家数据可用的分布外环境推导奖励,从而实现桌面操控的跨本体(cross-embodiment)泛化。我们将本工作视为从无标签视频中进行可扩展奖励指定的起点,其将受益于生成建模的快速进展。源代码与数据集见项目网站:https://escontrela.me/viper
引用
@article{arxiv.2305.14343,
title = {Video Prediction Models as Rewards for Reinforcement Learning},
author = {Alejandro Escontrela and Ademi Adeniji and Wilson Yan and Ajay Jain and Xue Bin Peng and Ken Goldberg and Youngwoon Lee and Danijar Hafner and Pieter Abbeel},
journal= {arXiv preprint arXiv:2305.14343},
year = {2023}
}
备注
22 pages, 18 figures, 4 tables. under review