中文

DMC-VB:用于处理视觉干扰项控制表示学习的基准

机器学习 2024-09-30 v1

摘要

通过行为克隆或离线强化学习(RL)从以前收集的数据中学习是一种强大的配方,用于通过避免昂贵的在线学习来扩展通用智能体。尽管在某些方面表现出强大的泛化能力,但智能体往往对控制无关因素(如背景或相机视角)的微小视觉变化极其脆弱。本文提出了DeepMind Control Visual Benchmark(DMC-VB),一个收集于 DeepMind Control Suite 中的数据集,用于评估在视觉干扰存在下,离线 RL 智能体从视觉输入解决连续控制任务的鲁棒性。与先前工作不同,本数据集(1)组合了难度不同的 locomotion 和 navigation 任务,(2)包括静态和动态视觉变化,(3)考虑由不同技能水平的策略生成的数据,(4)系统性地返回状态与像素观察的配对,(5)规模是原来的一个数量级,(6)包括隐藏目标任务。配合我们的数据集,本文提出了三个基准来评估表示学习方法的预训练效果,并在几个最近提出的方法上进行实验。首先,我们发现预训练的表示在 DMC-VB 上对策略学习没有帮助,我们指出了在像素观察和状态之间存在较大的表示差距。其次,我们演示了在专家数据有限的情况下,策略学习可以从(1)次优数据预训练,以及(2)具有随机隐藏目标的任务预训练中受益。我们的数据集和基准代码可在 https://github.com/google-deepmind/dmc_vision_benchmark 提供。

关键词

引用

@article{arxiv.2409.18330,
  title  = {DMC-VB: A Benchmark for Representation Learning for Control with Visual Distractors},
  author = {Joseph Ortiz and Antoine Dedieu and Wolfgang Lehrach and Swaroop Guntupalli and Carter Wendelken and Ahmad Humayun and Guangyao Zhou and Sivaramakrishnan Swaminathan and Miguel Lázaro-Gredilla and Kevin Murphy},
  journal= {arXiv preprint arXiv:2409.18330},
  year   = {2024}
}

备注

NeurIPS 2024 Datasets and Benchmarks Track. Dataset available at: https://github.com/google-deepmind/dmc_vision_benchmark