中文

用于视频对象分割的双流网络

计算机视觉与模式识别 2022-08-09 v1

摘要

现有的基于匹配的方法通过从像素级记忆中检索支持特征来执行视频对象分割(VOS),然而一些像素可能在记忆中缺乏对应关系(即未见过),这不可避免地限制了其分割性能。本文提出一种双流网络(TSN)。我们的TSN包括:(i)带有常规像素级记忆的像素流,基于像素级记忆检索分割已见像素;(ii)针对未见像素的实例流,通过对目标实例特征进行条件化的动态分割头获得实例的整体理解;(iii)生成路由图的像素划分模块,据此将两流的输出嵌入融合在一起。紧凑的实例流有效提升了未见像素的分割精度,而利用自适应路由图融合两流带来了整体性能提升。通过大量实验,我们证明了所提TSN的有效性,并在YouTube-VOS 2018上取得86.1%、在DAVIS-2017验证集划分上取得87.5%的SOTA性能。

关键词

引用

@article{arxiv.2208.04026,
  title  = {Two-Stream Networks for Object Segmentation in Videos},
  author = {Hannan Lu and Zhi Tian and Lirong Yang and Haibing Ren and Wangmeng Zuo},
  journal= {arXiv preprint arXiv:2208.04026},
  year   = {2022}
}