学习快速且鲁棒的目标模型用于视频目标分割
计算机视觉与模式识别
2020-04-01 v2
摘要
视频目标分割(VOS)是一个极具挑战性的问题,因为定义目标对象的初始掩码仅在测试时给出。主要困难在于有效处理外观变化与相似背景对象,同时保持准确分割。大多数先前方法在第一帧上微调分割网络,导致不实用的帧率与过拟合风险。更新的方法集成了生成式目标外观模型,但要么鲁棒性有限,要么需要大量训练数据。我们提出了一种由两网络组件构成的新型 VOS 架构。目标外观模型由一个轻量模块组成,在推理阶段使用快速优化技术学习,以预测粗糙但鲁棒的目标分割。分割模型完全离线训练,旨在将粗糙分数处理为高质量分割掩码。我们的方法快速、易于训练,并在训练数据有限的情况下仍保持高效。我们在具挑战性的 YouTube-VOS 与 DAVIS 数据集上进行了大量实验。我们的网络取得了优异性能,同时相较最先进水平以更高帧率运行。代码与训练模型见 https://github.com/andr345/frtm-vos。
引用
@article{arxiv.2003.00908,
title = {Learning Fast and Robust Target Models for Video Object Segmentation},
author = {Andreas Robinson and Felix Järemo Lawin and Martin Danelljan and Fahad Shahbaz Khan and Michael Felsberg},
journal= {arXiv preprint arXiv:2003.00908},
year = {2020}
}
备注
CVPR 2020. arXiv admin note: substantial text overlap with arXiv:1904.08630