中文

VMFormer:基于Transformer的端到端视频抠像

计算机视觉与模式识别 2022-12-01 v2

摘要

视频抠像旨在从给定输入视频序列中预测每一帧的alpha遮罩。近年来,深度卷积神经网络(CNN)主导了视频抠像的解决方案,已成为学术界与工业界的事实标准。然而,由于基于CNN的架构,它们具有局部性的内建归纳偏置,无法捕获图像的全局特征。在处理多帧特征图时,考虑到计算成本,它们也缺乏长程时间建模。本文中,我们提出VMFormer:一种基于transformer的端到端视频抠像方法。它从给定视频输入序列的可学习查询出发,预测每帧的alpha遮罩。具体而言,它利用自注意力层在连续帧的短程时间建模上构建特征序列的全局整合。我们进一步应用查询通过transformer解码器中的交叉注意力,在所有查询上进行长程时间建模以学习全局表示。在预测阶段,查询与相应特征图均用于最终alpha遮罩的预测。实验表明,VMFormer在合成基准上优于先前基于CNN的视频抠像方法。据我们所知,它是首个构建于全视觉transformer之上、基于可学习查询进行预测的端到端视频抠像方案。项目已开源:https://chrisjuniorli.github.io/project/VMFormer/

关键词

引用

@article{arxiv.2208.12801,
  title  = {VMFormer: End-to-End Video Matting with Transformer},
  author = {Jiachen Li and Vidit Goel and Marianna Ohanyan and Shant Navasardyan and Yunchao Wei and Humphrey Shi},
  journal= {arXiv preprint arXiv:2208.12801},
  year   = {2022}
}

备注

Project Page at https://chrisjuniorli.github.io/project/VMFormer/