中文

DMM-Net:用于视频对象分割的可微掩码匹配网络

计算机视觉与模式识别 2019-09-30 v1

摘要

本文中,我们提出可微掩码匹配网络(DMM-Net)来解决提供初始对象掩码的视频对象分割问题。基于 Mask R-CNN 骨干网络,我们提取每帧的掩码候选,并将一个时间步上对象模板与候选之间的匹配表述为一个线性分配问题,其中代价矩阵由 CNN 预测。我们通过展开投影梯度下降算法提出一个可微匹配层,其中投影利用 Dykstra 算法。我们证明在温和条件下,匹配保证收敛到最优解。实践中,它在推理时表现与匈牙利算法类似。同时,我们可以对其反向传播以学习代价矩阵。匹配后,利用一个细化头来改善匹配掩码的质量。我们的 DMM-Net 在最大的视频对象分割数据集 YouTube-VOS 上取得了有竞争力的结果。在 DAVIS 2017 上,DMM-Net 在不对首帧进行在线学习的情况下取得了最佳性能。无需任何微调,DMM-Net 在 SegTrack v2 数据集上的表现与最先进方法相当。最后,我们的匹配层非常易于实现;我们在补充材料中附上了 PyTorch 代码(<50<50 行)。我们的代码发布于 https://github.com/ZENGXH/DMM_Net。

关键词

引用

@article{arxiv.1909.12471,
  title  = {DMM-Net: Differentiable Mask-Matching Network for Video Object Segmentation},
  author = {Xiaohui Zeng and Renjie Liao and Li Gu and Yuwen Xiong and Sanja Fidler and Raquel Urtasun},
  journal= {arXiv preprint arXiv:1909.12471},
  year   = {2019}
}

备注

ICCV 2019