中文

一种用于端到端视频对象分割的生成式外观模型

计算机视觉与模式识别 2018-12-10 v2

摘要

视频对象分割的基本挑战之一是为目标与背景外观寻找有效表示。性能最优的方法为此求助于对卷积神经网络进行大量微调。除计算代价高昂外,该策略无法真正端到端训练,因为在线微调过程并未整合进网络的离线训练。为解决这些问题,我们提出一种网络架构,在单次前向传播中学习目标与背景外观的有力表示。所引入的外观模块学习目标与背景特征分布的概率生成式模型。给定新图像,它预测后验类别概率,提供极具判别性的线索,供后续网络模块处理。我们外观模块的学习与预测阶段均完全可微,从而实现整个分割流程的真正端到端训练。综合实验在三个视频对象分割基准上证明了所提方法的有效性。我们在 DAVIS17 上缩小了与基于在线微调方法的差距,同时在单 GPU 上以 15 FPS 运行。此外,我们的方法在大规模 YouTube-VOS 数据集上优于所有已发表的方法。

关键词

引用

@article{arxiv.1811.11611,
  title  = {A Generative Appearance Model for End-to-end Video Object Segmentation},
  author = {Joakim Johnander and Martin Danelljan and Emil Brissman and Fahad Shahbaz Khan and Michael Felsberg},
  journal= {arXiv preprint arXiv:1811.11611},
  year   = {2018}
}