中文

基于自监督方法预训练视觉 Transformer 用于基于视觉的深度强化学习

机器学习 2023-07-20 v2

摘要

Vision Transformer 架构已在计算机视觉(CV)领域显示出竞争力,在多个基准中取代了基于卷积的网络。然而,卷积神经网络(CNN)仍是强化学习中表示模块的首选架构。在本工作中,我们研究使用多种最先进自监督方法预训练 Vision Transformer 并评估所学表示的质量。为展示时间维度在此背景下的重要性,我们提出 VICReg 的一种扩展,通过增加时间顺序验证任务来更好地捕捉观测间的时间关系。我们的结果表明,所有方法都能有效学习有用表示并避免来自 Atari Learning Environment(ALE)观测的表示崩溃,从而在强化学习(RL)评估中带来数据效率的提升。此外,经时间顺序验证任务预训练的编码器在所有实验中表现最佳,具有更丰富的表示、更聚焦的注意力图以及贯穿编码器各层更稀疏的表示向量,这表明探索此类相似性维度的重要性。通过本工作,我们希望对 ViT 在来自 RL 环境的观测自监督预训练中所学表示提供一些见解,以及表示中哪些特性催生了性能最佳的智能体。源代码将发布于:https://github.com/mgoulao/TOV-VICReg

关键词

引用

@article{arxiv.2209.10901,
  title  = {Pretraining the Vision Transformer using self-supervised methods for vision based Deep Reinforcement Learning},
  author = {Manuel Goulão and Arlindo L. Oliveira},
  journal= {arXiv preprint arXiv:2209.10901},
  year   = {2023}
}