面向快速视频对象分割的方向性深度嵌入与表观学习
计算机视觉与模式识别
2020-02-18 v1
摘要
大多数近期半监督视频对象分割(VOS)方法依赖于利用第一帧给定掩码或后续帧预测掩码在线微调深度卷积神经网络。然而,在线微调过程通常耗时,限制了此类方法的实际应用。我们提出一种无需在线微调过程的方向性深度嵌入与表观学习(DDEAL)方法,用于快速VOS。首先,提出一个可通过并行卷积操作高效实现的全局方向匹配模块,以学习语义逐像素嵌入作为内部引导。其次,提出一种基于统计的有效方向表观模型,在球形嵌入空间上表示目标与背景用于VOS。借助全局方向匹配模块与方向表观模型学习模块,DDEAL从带标注的第一帧学习静态线索,并动态更新后续帧的线索以进行对象分割。我们的方法在不使用在线微调的情况下展现出最先进的VOS性能。具体而言,其在DAVIS 2017数据集上取得74.8%的J&F平均得分,在大规模YouTube-VOS数据集上取得71.3%的综合得分G,同时在单块NVIDIA TITAN Xp GPU上保持25 fps速度。此外,我们的更快版本仅以微小精度损失运行于31 fps。我们的代码与训练网络见于 https://github.com/YingjieYin/Directional-Deep-Embedding-and-Appearance-Learning-for-Fast-Video-Object-Segmentation。
引用
@article{arxiv.2002.06736,
title = {Directional Deep Embedding and Appearance Learning for Fast Video Object Segmentation},
author = {Yingjie Yin and De Xu and Xingang Wang and Lei Zhang},
journal= {arXiv preprint arXiv:2002.06736},
year = {2020}
}