中文

面向高效视频目标分割的双时序记忆网络

计算机视觉与模式识别 2020-03-16 v1

摘要

视频目标分割(VOS)通常以半监督设定形式化。给定第一帧的地面真值分割掩码,VOS 的任务是像素级跟踪并分割视频后续帧中单个或多个感兴趣对象。VOS 的基本挑战之一是如何最大程度利用时序信息以提升性能。我们提出一种端到端网络,将当前帧之前的短时序与长时序视频序列信息存储为时序记忆,以应对 VOS 中的时序建模。我们的网络由两个时序子网络组成:短时序记忆子网络与长时序记忆子网络。短时序记忆子网络通过基于图的学习框架建模视频中相邻帧间局部区域的细粒度时空交互,可良好保持局部区域随时间的视觉一致性。长时序记忆子网络通过简化门控循环单元(S-GRU)建模对象的长期演化,使分割对遮挡与漂移误差具有鲁棒性。实验中,我们表明所提方法在 DAVIS 2016、DAVIS 2017 与 Youtube-VOS 三个常用 VOS 数据集上于速度与精度方面均取得良好且具竞争力的性能。

关键词

引用

@article{arxiv.2003.06125,
  title  = {Dual Temporal Memory Network for Efficient Video Object Segmentation},
  author = {Kaihua Zhang and Long Wang and Dong Liu and Bo Liu and Qingshan Liu and Zhu Li},
  journal= {arXiv preprint arXiv:2003.06125},
  year   = {2020}
}

备注

10 pages, 5 figures