中文

面向高效交互式视频对象分割的记忆聚合网络

计算机视觉与模式识别 2020-03-31 v1

摘要

交互式视频对象分割(iVOS)旨在借助用户交互高效获取视频中目标对象的高质量分割掩码。以往大多数最优方法采用两个独立网络分别进行用户交互和时间传播,导致推理阶段效率低下。本文提出一种统一框架,称为记忆聚合网络(MA-Net),以更高效的方式解决具有挑战性的 iVOS 问题。我们的 MA-Net 将交互与传播操作集成到单一网络中,在多轮交互方案下显著提升了 iVOS 的效率。更重要的是,我们提出了一种简单而有效的记忆聚合机制,用于记录先前交互轮次中的有用知识,极大提升了发现困难感兴趣对象的鲁棒性。我们在 DAVIS Challenge 2018 基准的验证集上进行了大量实验。具体而言,我们的 MA-Net 在没有任何额外技巧的情况下取得了 76.1% 的 J@60 分数,以超过 2.7% 的优势优于现有最优方法。

关键词

引用

@article{arxiv.2003.13246,
  title  = {Memory Aggregation Networks for Efficient Interactive Video Object Segmentation},
  author = {Jiaxu Miao and Yunchao Wei and Yi Yang},
  journal= {arXiv preprint arXiv:2003.13246},
  year   = {2020}
}

备注

Accepted to CVPR 2020. 10 pages, 9 figures