为 OSVOS 辩护
计算机视觉与模式识别
2019-08-21 v2
摘要
作为视频目标分割的里程碑,一次性视频目标分割(OSVOS)相较于传统的基于光流的方法在分割精度上取得了大幅领先。其优异性能主要得益于三步训练机制:即(1)在基础数据集(即 ImageNet)上获取目标特征;(2)在目标数据集(即 DAVIS-2016)的训练集上训练父网络,使其能区分感兴趣目标与背景;(3)在目标测试集的第一帧上对感兴趣目标进行在线微调以过拟合其外观,随后该模型可用于分割该视频其余帧中的同一目标。本文中我们认为,对于步骤(2),OSVOS 存在“过度强调”通用语义目标信息而“稀释”目标实例线索的局限,这极大阻碍了整个训练过程。通过增加一个通用模块——视频损失(我们以多种约束形式构建,包括加权 BCE 损失、高维三元组损失以及一种新颖的混合实例感知视频损失)——在步骤(2)中训练父网络,该网络便能为步骤(3)即目标实例上的在线微调做更好准备。通过使用不同网络结构作为骨干的广泛实验,我们表明所提出的视频损失模块相比 OSVOS 能显著提升分割性能。同时,由于视频损失是一个通用模块,它可推广至其他基于微调的方法及深度估计、显著性检测等类似视觉任务。
引用
@article{arxiv.1908.06692,
title = {In defense of OSVOS},
author = {Yu Liu and Yutong Dai and Anh-Dzung Doan and Lingqiao Liu and Ian Reid},
journal= {arXiv preprint arXiv:1908.06692},
year = {2019}
}