中文

Hybrid-S2S:基于循环网络与对应匹配的视频对象分割

计算机视觉与模式识别 2020-11-10 v2

摘要

一次性视频对象分割~(VOS) 是在视频序列中逐像素跟踪感兴趣对象的任务,推理时给定第一帧的分割掩码。近年来,循环神经网络~(RNNs) 已被广泛用于 VOS 任务,但它们常受漂移与误差传播等局限的困扰。在本工作中,我们研究一种基于 RNN 的架构,并通过提出一种名为 HS2S 的混合序列到序列架构来解决其中部分问题,该架构利用双掩码传播策略,可融入从对应匹配中获得的信息。我们的实验表明,用对应匹配增强 RNN 是减轻漂移问题的高效方案。附加信息帮助模型预测更精确的掩码,并使其对误差传播具有鲁棒性。我们在 DAVIS2017 数据集与 Youtube-VOS 上评估了我们的 HS2S 模型。在后者上,相较基于 RNN 的 VOS 最优方法,我们的整体分割精度提升了 11.2 个百分点。我们分析了模型在遮挡与长序列等挑战性情形下的表现,并展示我们的混合架构在这些困难场景中显著提升了分割质量。

关键词

引用

@article{arxiv.2010.05069,
  title  = {Hybrid-S2S: Video Object Segmentation with Recurrent Networks and Correspondence Matching},
  author = {Fatemeh Azimi and Stanislav Frolov and Federico Raue and Joern Hees and Andreas Dengel},
  journal= {arXiv preprint arXiv:2010.05069},
  year   = {2020}
}