中文

FEELVOS:用于视频目标分割的快速端到端嵌入学习

计算机视觉与模式识别 2019-04-09 v2

摘要

许多近期成功的视频目标分割(VOS)方法过于复杂,严重依赖在第一帧上微调,且/或速度慢,因此实际用途有限。本工作中,我们提出FEELVOS作为一种简单快速且不依赖微调的方法。为分割视频,对于每一帧,FEELVOS使用语义逐像素嵌入以及全局和局部匹配机制,将视频首帧与前一帧的信息传递至当前帧。与以往工作不同,我们的嵌入仅用作卷积网络的内部引导。我们新颖的动态分割头允许我们以交叉熵损失为多个目标分割任务端到端地训练网络(包括嵌入)。我们在DAVIS 2017验证集上以71.5%的J&F指标实现了无需微调的视频目标分割新state of the art。我们在 https://github.com/tensorflow/models/tree/master/research/feelvos 提供了代码与模型。

关键词

引用

@article{arxiv.1902.09513,
  title  = {FEELVOS: Fast End-to-End Embedding Learning for Video Object Segmentation},
  author = {Paul Voigtlaender and Yuning Chai and Florian Schroff and Hartwig Adam and Bastian Leibe and Liang-Chieh Chen},
  journal= {arXiv preprint arXiv:1902.09513},
  year   = {2019}
}

备注

CVPR 2019 camera-ready version