中文

评估用于基于像素的深度强化学习的视觉Transformer方法

机器学习 2022-05-17 v2 计算机视觉与模式识别 机器人学

摘要

视觉Transformer(ViT)最近展示了Transformer架构在计算机视觉中的显著潜力。与标准卷积神经网络(CNN)架构相比,基于图像的深度强化学习在多大程度上也能受益于ViT架构?为回答此问题,我们评估了用于基于图像的强化学习(RL)控制任务的ViT训练方法,并将这些结果与领先的卷积网络架构方法RAD进行比较。对于训练ViT编码器,我们考虑了几种最近提出的被当作辅助任务的自我监督损失,以及无额外损失项的基线。我们发现,使用RAD训练的CNN架构仍普遍提供更优性能。对于ViT方法,我们所考虑的所有三类辅助任务都比普通ViT训练提供了益处。此外,发现ViT基于重建的任务显著优于ViT对比学习。

关键词

引用

@article{arxiv.2204.04905,
  title  = {Evaluating Vision Transformer Methods for Deep Reinforcement Learning from Pixels},
  author = {Tianxin Tao and Daniele Reda and Michiel van de Panne},
  journal= {arXiv preprint arXiv:2204.04905},
  year   = {2022}
}