中文

VRL3:一种用于视觉深度强化学习的数据驱动框架

计算机视觉与模式识别 2023-04-03 v3 人工智能 机器学习 机器人学

摘要

我们提出了 VRL3,一个设计简单但强大的数据驱动框架,用于解决具有挑战性的视觉深度强化学习(DRL)任务。我们分析了采用数据驱动方法时面临的若干主要障碍,并提出了一套关于数据驱动视觉 DRL 的设计原则、新发现和关键见解。我们的框架分为三个阶段:阶段 1,我们利用非强化学习数据集(如 ImageNet)学习任务无关的视觉表示;阶段 2,我们使用离线 RL 数据(如有限数量的专家演示)将任务无关的表示转化为更强大的任务特定表示;阶段 3,我们使用在线 RL 对智能体进行微调。在一组具有稀疏奖励和真实视觉输入的挑战性手部操作任务上,与之前的 SOTA 相比,VRL3 实现了平均 780% 更好的样本效率。在最困难的任务上,VRL3 的样本效率提高了 1220%(使用更宽编码器时达 2440%),且仅用 10% 的计算量就解决了该任务。这些显著结果清楚地展示了数据驱动深度强化学习的巨大潜力。

关键词

引用

@article{arxiv.2202.10324,
  title  = {VRL3: A Data-Driven Framework for Visual Deep Reinforcement Learning},
  author = {Che Wang and Xufang Luo and Keith Ross and Dongsheng Li},
  journal= {arXiv preprint arXiv:2202.10324},
  year   = {2023}
}

备注

41 pages, camera-ready final version, accepted to NeurIPS 2022