SpVOS:基于三重稀疏卷积的高效视频目标分割
计算机视觉与模式识别
2023-10-24 v1
摘要
半监督视频目标分割(Semi-VOS)仅需标注视频首帧即可分割后续帧,近年来受到越来越多的关注。在现有流程中,基于记忆匹配的方法正成为主流研究路线,因其可充分利用时序信息获得高质量分割结果。尽管此类方法已取得良好性能,整体框架仍受沉重计算开销所累,主要源于高分辨率特征图与每个卷积核之间的逐帧密集卷积操作。因此,本文提出一种名为SpVOS的VOS稀疏基线,其开发了一种新颖的三重稀疏卷积以降低整体VOS框架的计算成本。所设计的三重门在充分考虑相邻视频帧间时空冗余的基础上,自适应地做出三重决策,以决定如何对每个像素应用稀疏卷积,从而控制各层计算开销,同时保持足够的判别能力以区分相似目标并避免误差累积。我们还提出了一种混合稀疏训练策略,并结合考虑稀疏性约束的设计目标,以平衡VOS分割性能与计算成本。实验在DAVIS和Youtube-VOS两个主流VOS数据集上进行。结果表明,所提SpVOS优于其他最先进的稀疏方法,甚至保持了可比性能,例如在DAVIS-2017(Youtube-VOS)验证集上取得83.04%(79.29%)的综合得分,而典型非稀疏VOS基线为(DAVIS-2017 82.88%,Youtube-VOS 80.36%),同时节省高达42%的FLOPs,展现了其在资源受限场景中的应用潜力。
引用
@article{arxiv.2310.15115,
title = {SpVOS: Efficient Video Object Segmentation with Triple Sparse Convolution},
author = {Weihao Lin and Tao Chen and Chong Yu},
journal= {arXiv preprint arXiv:2310.15115},
year = {2023}
}
备注
15 pages, 6 figures