中文

利用Transformers关联物体进行视频物体分割

计算机视觉与模式识别 2021-11-02 v3

摘要

本文研究如何实现更好且更高效的嵌入学习,以应对挑战性多物体场景下半监督视频物体分割问题。最先进的方法学习用单个正物体解码特征,因此在多物体场景下不得不分别匹配与分割每个目标,消耗数倍计算资源。为解决该问题,我们提出一种利用Transformers关联物体(Associating Objects with Transformers,AOT)的方法,统一匹配与解码多个物体。具体而言,AOT采用一种识别机制将多个目标关联到同一高维嵌入空间。因此,我们可以像处理单个物体一样高效地同时处理多个物体的匹配与分割解码。为充分建模多物体关联,设计了一种长短期Transformer以构建分层匹配与传播。我们在多物体与单物体基准上进行了大量实验,以测试不同复杂度的AOT变体网络。特别地,我们的R50-AOT-L在三个流行基准即YouTube-VOS(84.1% J&F)、DAVIS 2017(84.9%)和DAVIS 2016(91.1%)上优于所有state-of-the-art竞争者,同时保持超过3×3\times更快的多物体运行时间。同时,我们的AOT-T能在上述基准上保持实时多物体速度。基于AOT,我们在第三届大规模VOS挑战赛中排名第1。

关键词

引用

@article{arxiv.2106.02638,
  title  = {Associating Objects with Transformers for Video Object Segmentation},
  author = {Zongxin Yang and Yunchao Wei and Yi Yang},
  journal= {arXiv preprint arXiv:2106.02638},
  year   = {2021}
}

备注

NeurIPS 2021. 20 pages, 9 figures, 5 tables