用于高效策略学习的预训练视觉动力学表征
计算机视觉与模式识别
2024-11-06 v1 机器学习
摘要
仅使用视频数据进行强化学习(RL)的预训练是一个有价值但具有挑战性的问题。尽管野外视频易于获取且蕴含大量先验世界知识,但缺乏动作标注以及与下游任务之间普遍存在的领域差距阻碍了利用视频进行 RL 预训练。为了应对使用视频进行预训练的挑战,我们提出了预训练视觉动力学表征(PVDR),以弥合视频与下游任务之间的领域差距,从而实现高效策略学习。通过采用视频预测作为预训练任务,我们使用基于 Transformer 的条件变分自编码器(CVAE)来学习视觉动力学表征。预训练的视觉动力学表征捕获了视频中的视觉动力学先验知识。这种抽象的先验知识可以很容易地适应下游任务,并通过在线适应与可执行动作对齐。我们在一系列机器人视觉控制任务上进行了实验,并验证了 PVDR 是一种利用视频进行预训练以促进策略学习的有效形式。
引用
@article{arxiv.2411.03169,
title = {Pre-trained Visual Dynamics Representations for Efficient Policy Learning},
author = {Hao Luo and Bohan Zhou and Zongqing Lu},
journal= {arXiv preprint arXiv:2411.03169},
year = {2024}
}
备注
ECCV 2024