通过时空对应学习提升视频目标分割
计算机视觉与模式识别
2023-04-14 v1
摘要
当前视频目标分割(VOS)的顶尖方案通常遵循基于匹配的范式:对每帧查询帧,根据其与前序已处理帧及首帧标注帧的对应关系推断分割掩码。它们仅利用来自真值掩码的监督信号学习掩码预测,未对时空对应匹配施加任何约束,而后者恰是该范式的根本基石。为缓解这一关键却常被忽视的问题,我们设计了一种对应感知训练框架,通过在网络学习中显式鼓励鲁棒对应匹配来提升基于匹配的VOS方案。通过全面挖掘视频在像素与对象层级的内在一致性,我们的算法以无标签对比对应学习强化了掩码分割的标准全监督训练。我们的算法在训练时无需额外标注成本,部署时不引起速度延迟,也不引发架构修改,在四个广泛使用的基准(即DAVIS2016&2017与YouTube-VOS2018&2019)上基于著名基于匹配的VOS方案取得了稳健性能提升。
引用
@article{arxiv.2304.06211,
title = {Boosting Video Object Segmentation via Space-time Correspondence Learning},
author = {Yurong Zhang and Liulei Li and Wenguan Wang and Rong Xie and Li Song and Wenjun Zhang},
journal= {arXiv preprint arXiv:2304.06211},
year = {2023}
}
备注
CVPR 2023; Project page: https://github.com/wenguanwang/VOS_Correspondence