中文

基于视觉观测的离线强化学习:挑战与机遇

机器学习 2023-07-07 v3 人工智能 计算机视觉与模式识别 机器学习

摘要

离线强化学习在利用大规模预收集数据集进行策略学习方面已展现出巨大潜力,使智能体得以省去通常代价高昂的在线数据收集。然而,基于视觉观测且具连续动作空间的离线强化学习仍待深入探索,人们对该复杂领域关键挑战的理解十分有限。本文中,我们为视觉域中的连续控制建立了简单基线,并引入了一套用于基于视觉观测的离线强化学习的基准测试任务,这些任务旨在更好地表征真实世界离线RL问题中存在的数据分布,并受一组针对视觉观测离线RL的期望性质(包括对环境视觉干扰的鲁棒性以及动力学中可视觉辨识的变化)指导。利用该基准测试任务套件,我们展示了对两种流行的基于视觉的在线强化学习算法 DreamerV2 和 DrQ-v2 的简单修改,便足以超越现有离线RL方法,并确立视觉域中连续控制的竞争性基线。我们严格评估了这些算法,并对最先进的基于模型与无模型的视觉观测连续控制离线RL方法进行了经验性评估。本评估中使用的所有代码与数据均已开源,以促进该领域进展。

关键词

引用

@article{arxiv.2206.04779,
  title  = {Challenges and Opportunities in Offline Reinforcement Learning from Visual Observations},
  author = {Cong Lu and Philip J. Ball and Tim G. J. Rudner and Jack Parker-Holder and Michael A. Osborne and Yee Whye Teh},
  journal= {arXiv preprint arXiv:2206.04779},
  year   = {2023}
}

备注

Published at TMLR, 2023