中文

面向强化学习的无监督视觉注意力与不变性

机器人学 2021-04-20 v2 计算机视觉与模式识别

摘要

基于视觉的强化学习(RL)已取得成效,但如何将其推广到未知测试环境仍具挑战。现有方法侧重于训练对变化的视觉域具有通用性的 RL 策略,而我们侧重于提取具有通用性的视觉前景,将干净的不变视觉输入提供给 RL 策略学习器。我们的方法完全无监督,无需人工标注或访问环境内部。给定训练环境中动作的视频,我们通过无监督关键点检测学习如何提取前景,随后通过无监督视觉注意力自动生成每视频帧的前景掩码。我们随后可引入人工干扰物,并训练模型从含噪观测中重建干净的前景掩码。测试时仅需该已训练模型为 RL 策略学习器提供无干扰的视觉输入。我们的视觉注意力与不变性(VAI)方法在视觉域泛化上显著优于当前最优方法,在 DeepMind Control(我们的 DrawerWorld Manipulation)基准上每回合累积奖励提升 15% 至 49%(61% 至 229%)。我们的结果表明,不仅可在无任何监督下学习域不变视觉,且将 RL 从视觉干扰中解放亦使策略更专注从而表现远优。

关键词

引用

@article{arxiv.2104.02921,
  title  = {Unsupervised Visual Attention and Invariance for Reinforcement Learning},
  author = {Xudong Wang and Long Lian and Stella X. Yu},
  journal= {arXiv preprint arXiv:2104.02921},
  year   = {2021}
}

备注

Accepted at CVPR 2021