面向视频实例分割的时间高效视觉 Transformer
计算机视觉与模式识别
2022-04-19 v1
摘要
近年来视觉 transformer 在图像级视觉识别任务上取得了巨大成功。为高效且有效地建模视频片段中的关键时间信息,我们提出一种用于视频实例分割(VIS)的时间高效视觉 Transformer(TeViT)。与以往基于 transformer 的 VIS 方法不同,TeViT 几乎无卷积,其包含一个 transformer 骨干网络和一个基于查询的视频实例分割头。在骨干阶段,我们提出一种近乎无参数的信使偏移机制用于早期时间上下文融合。在头阶段,我们提出参数共享的时空查询交互机制,以建立视频实例与查询之间的一一对应。因此,TeViT 充分利用帧级和实例级时间上下文信息,以可忽略的额外计算代价获得强的时间建模能力。在三个广泛采用的 VIS 基准,即 YouTube-VIS-2019、YouTube-VIS-2021 和 OVIS 上,TeViT 取得了最先进的结果并保持了高推理速度,例如在 YouTube-VIS-2019 上以 68.9 FPS 达到 46.6 AP。代码见 https://github.com/hustvl/TeViT。
引用
@article{arxiv.2204.08412,
title = {Temporally Efficient Vision Transformer for Video Instance Segmentation},
author = {Shusheng Yang and Xinggang Wang and Yu Li and Yuxin Fang and Jiemin Fang and Wenyu Liu and Xun Zhao and Ying Shan},
journal= {arXiv preprint arXiv:2204.08412},
year = {2022}
}
备注
To appear in CVPR 2022