视频增强的离线强化学习:一种基于模型的方法
机器学习
2025-05-20 v2 人工智能
机器人学
摘要
离线强化学习(RL)通过使用静态数据集来实现策略优化,避免了大规模实际环境探索的风险和成本。然而,由于缺乏环境交互,离线强化学习面临次优离线行为和不准确的价值估计问题。我们提出了视频增强的离线强化学习(Video-Enhanced Offline RL,VeoRL)方法,这是一种基于模型的方法,从可轻松获取的多样化、无标签视频数据构建交互式世界模型。利用基于模型的行为指导,我们的方法将自然视频中对控制策略和物理动力学的常识知识迁移到目标领域内的强化学习代理中。VeoRL 在机器人操作、自动驾驶和开放世界视频游戏中的视觉控制任务中实现了显著的性能提升(部分情况下提升超过 100%)。
引用
@article{arxiv.2505.06482,
title = {Video-Enhanced Offline Reinforcement Learning: A Model-Based Approach},
author = {Minting Pan and Yitao Zheng and Jiajian Li and Yunbo Wang and Xiaokang Yang},
journal= {arXiv preprint arXiv:2505.06482},
year = {2025}
}