中文

基于时空图神经网络的端到端视频实例分割

计算机视觉与模式识别 2022-03-08 v1

摘要

视频实例分割是一项将图像实例分割扩展至视频领域的挑战性任务。现有方法或仅依赖单帧信息处理检测与分割子问题,或将跟踪作为独立后处理步骤,这限制了它们为所有子问题充分借助与共享有用时空信息的能力。本文提出一种基于图神经网络 (GNN) 的新方法以克服上述局限。具体而言,代表实例特征的图节点用于检测与分割,而代表实例关系的图边用于跟踪。帧间与帧内信息通过图更新得到有效传播与共享,且所有子问题(即检测、分割与跟踪)在统一框架中联合优化。与现有方法相比,我们的方法在YoutubeVIS验证集上性能大幅提升,以ResNet-50为骨干网络取得35.2% AP,运行速度为22 FPS。代码见 http://github.com/lucaswithai/visgraph.git 。

关键词

引用

@article{arxiv.2203.03145,
  title  = {End-to-end video instance segmentation via spatial-temporal graph neural networks},
  author = {Tao Wang and Ning Xu and Kean Chen and Weiyao Lin},
  journal= {arXiv preprint arXiv:2203.03145},
  year   = {2022}
}

备注

Accepted by ICCV 2021