将离线 RL 转为在线:面向离线视觉强化学习的协作世界模型
机器学习
2024-10-30 v4
摘要
使用视觉输入训练离线 RL 模型面临两个重大挑战,即表示学习中的过拟合问题和对未来期望奖励的高估偏差。近期工作试图通过鼓励保守行为来缓解高估偏差。相比之下,本文试图为价值估计构建更灵活的约束,而不阻碍对潜在优势的探究。关键思想是利用现成的 RL 模拟器(可以容易地以在线方式与之交互)作为离线策略的“试验台”。为了实现有效的在线到离线知识迁移,我们引入了 CoWorld,一种基于模型的 RL 方法,可缓解状态和奖励空间中的跨域差异。实验结果证明了 CoWorld 的有效性,以大幅优势优于现有的 RL 方法。
引用
@article{arxiv.2305.15260,
title = {Making Offline RL Online: Collaborative World Models for Offline Visual Reinforcement Learning},
author = {Qi Wang and Junming Yang and Yunbo Wang and Xin Jin and Wenjun Zeng and Xiaokang Yang},
journal= {arXiv preprint arXiv:2305.15260},
year = {2024}
}
备注
Accepted by NeurIPS 2024. Project page: https://qiwang067.github.io/coworld