基于Transformers的端到端视频实例分割
计算机视觉与模式识别
2021-10-11 v5
摘要
视频实例分割(VIS)是一项要求对视频中感兴趣的目标实例同时进行分类、分割与跟踪的任务。现有方法通常构建复杂的流水线来应对该任务。本文中,我们提出一种构建于Transformers之上的新视频实例分割框架,称为VisTR,其将VIS任务视为直接的端到端并行序列解码/预测问题。给定由多帧图像组成的视频片段作为输入,VisTR直接按顺序输出视频中每个实例的掩码序列。其核心是一种新颖且有效的实例序列匹配与分割策略,该策略在序列整体层面上监督并分割实例。VisTR将实例分割与跟踪置于相似性学习的同一视角下,从而大幅简化了整体流水线,并与现有方法显著不同。无需额外技巧,VisTR在所有现有VIS模型中速度最高,并在YouTube-VIS数据集上以单一模型使用的方法中取得最佳结果。我们首次展示了一种构建于Transformers之上、更为简单快速的视频实例分割框架,取得了具有竞争力的精度。我们希望VisTR能激励未来针对更多视频理解任务的研究。
引用
@article{arxiv.2011.14503,
title = {End-to-End Video Instance Segmentation with Transformers},
author = {Yuqing Wang and Zhaoliang Xu and Xinlong Wang and Chunhua Shen and Baoshan Cheng and Hao Shen and Huaxia Xia},
journal= {arXiv preprint arXiv:2011.14503},
year = {2021}
}
备注
CVPR2021 Oral