中文

使用卷积注入器适配预训练ViT进行视觉运动控制

计算机视觉与模式识别 2024-06-11 v1 机器学习 机器人学

摘要

视觉Transformer(ViT)与大规模预训练相结合时,由于它们较弱的归纳偏置,在各种计算机视觉任务中表现出色。然而,虽然这种弱归纳偏置有助于预训练的可扩展性,但由于缺乏以控制为中心的归纳偏置,这可能会阻碍ViT在视觉运动控制任务中的有效适配。这些缺失的归纳偏置包括卷积自然提供的空间局部性和平移等变性偏置。为此,我们引入了卷积注入器(CoIn),这是一个附加模块,它将富含局部性和等变性偏置的卷积注入到预训练的ViT中,以实现视觉运动控制中的有效适配。我们在三个不同领域(Adroit、MetaWorld、DMC)的12个不同控制任务中,使用三种不同类型的预训练ViT(CLIP、MVP、VC-1)评估了CoIn,并证明CoIn在所有实验环境和模型中一致地提升了控制任务性能,验证了为预训练ViT提供以控制为中心的偏置的有效性。

关键词

引用

@article{arxiv.2406.06072,
  title  = {Adapting Pretrained ViTs with Convolution Injector for Visuo-Motor Control},
  author = {Dongyoon Hwang and Byungkun Lee and Hojoon Lee and Hyunseung Kim and Jaegul Choo},
  journal= {arXiv preprint arXiv:2406.06072},
  year   = {2024}
}

备注

accepted to ICML 2024