VRL3:一种用于视觉深度强化学习的数据驱动框架
计算机视觉与模式识别
2023-04-03 v3 人工智能
机器学习
机器人学
摘要
我们提出了 VRL3,一个设计简单但强大的数据驱动框架,用于解决具有挑战性的视觉深度强化学习(DRL)任务。我们分析了采用数据驱动方法时面临的若干主要障碍,并提出了一套关于数据驱动视觉 DRL 的设计原则、新发现和关键见解。我们的框架分为三个阶段:阶段 1,我们利用非强化学习数据集(如 ImageNet)学习任务无关的视觉表示;阶段 2,我们使用离线 RL 数据(如有限数量的专家演示)将任务无关的表示转化为更强大的任务特定表示;阶段 3,我们使用在线 RL 对智能体进行微调。在一组具有稀疏奖励和真实视觉输入的挑战性手部操作任务上,与之前的 SOTA 相比,VRL3 实现了平均 780% 更好的样本效率。在最困难的任务上,VRL3 的样本效率提高了 1220%(使用更宽编码器时达 2440%),且仅用 10% 的计算量就解决了该任务。这些显著结果清楚地展示了数据驱动深度强化学习的巨大潜力。
引用
@article{arxiv.2202.10324,
title = {VRL3: A Data-Driven Framework for Visual Deep Reinforcement Learning},
author = {Che Wang and Xufang Luo and Keith Ross and Dongsheng Li},
journal= {arXiv preprint arXiv:2202.10324},
year = {2023}
}
备注
41 pages, camera-ready final version, accepted to NeurIPS 2022