中文

TransVOS:基于 Transformers 的视频目标分割

计算机视觉与模式识别 2021-09-21 v2 人工智能

摘要

近来,基于时空记忆网络(STM)的方法在半监督视频目标分割(VOS)中取得了最先进的性能。该任务中的一个关键问题是如何对不同时帧之间以及每一帧内部的相关性进行建模。然而,此类方法大多忽视空间关系(每帧内部)且未充分利用时间关系(不同时帧之间)。本文中,我们提出一种称为 TransVOS 的基于 transformer 的新框架,引入视觉 transformer 以充分挖掘并建模时间与空间关系。此外,大多数基于 STM 的方法采用两个独立的编码器分别提取两个重要输入的特征,即参考集(带预测掩码的历史帧)和查询帧(当前帧),增加了模型的参数量与复杂度。为在保持有效性的同时精简流行的双编码器流程,我们设计了一种单一双路径特征提取器以统一方式对上述两种输入进行编码。大量实验证明了我们的 TransVOS 在 DAVIS 和 YouTube-VOS 数据集上相对于最先进方法的优越性。

关键词

引用

@article{arxiv.2106.00588,
  title  = {TransVOS: Video Object Segmentation with Transformers},
  author = {Jianbiao Mei and Mengmeng Wang and Yeneng Lin and Yi Yuan and Yong Liu},
  journal= {arXiv preprint arXiv:2106.00588},
  year   = {2021}
}

备注

9 pages, 2 figures