中文

DRIBO:通过多视图信息瓶颈实现鲁棒深度强化学习

人工智能 2022-07-15 v4 机器学习

摘要

深度强化学习(DRL)智能体通常对训练环境中未出现过的视觉变化较为敏感。为解决该问题,我们利用强化学习的序列特性,基于无监督多视图设定学习仅从观测中编码任务相关信息的鲁棒表示。具体而言,我们针对时序数据引入了多视图信息瓶颈(MIB)目标的一个新颖对比版本。我们用这一辅助目标从像素训练 RL 智能体,以学习能够压缩掉任务无关信息并预测任务相关动力学的鲁棒表示。该方法使我们能够训练对视觉干扰鲁棒且能很好泛化至未知环境的高性能策略。我们证明,当背景被自然视频替换时,我们的方法在 DeepMind Control Suite 的多种视觉控制任务上可达到 SOTA 性能。此外,我们表明在 Procgen 基准上,我们的方法优于用于泛化至未知环境的成熟基线。我们的代码已开源,可在 https://github.com/BU-DEPEND-Lab/DRIBO 获取。

关键词

引用

@article{arxiv.2102.13268,
  title  = {DRIBO: Robust Deep Reinforcement Learning via Multi-View Information Bottleneck},
  author = {Jiameng Fan and Wenchao Li},
  journal= {arXiv preprint arXiv:2102.13268},
  year   = {2022}
}

备注

Accepted at ICML 2022, 29 pages