中文

大规模视频对象分割中的全局运动理解

计算机视觉与模式识别 2024-05-14 v1

摘要

本文表明,将其他视频理解领域的知识与大规模学习相结合,可提高视频对象分割(VOS)在复杂情境下的鲁棒性。具体而言,我们聚焦于将场景全局运动知识集成以改进大规模半监督视频对象分割。先前的VOS工作大多依赖直接比较语义和上下文特征,在当前帧和过去帧之间进行稠密匹配,忽略了实际的运动结构。另一方面,光流估计任务旨在近似场景运动场,暴露出通常在所有配对相似性搜索中难以发现的全局运动模式。我们提出了WarpFormer,一种用于半监督视频对象分割的架构,利用现有运动理解知识以实现更平滑的传播和更准确的匹配。我们的框架使用预训练的光流估计网络,其预测用于将过去帧和实例分割掩码映射到当前帧域。因此,经异位的分割掩码被细化和融合,以填充被遮挡区域并消除由流场不完美导致的伪影。此外,我们采用新开发的大规模MOSE 2023数据集进行训练,以涵盖各种复杂情境。我们的方法在DAVIS 2016/2017验证集(93.0%和85.9%)、DAVIS 2017 test-dev(80.6%)和YouTube-VOS 2019验证集(83.8%)表现强劲,与替代性最先进方法相当,却使用更简单的数据存储机制和实例理解逻辑。

关键词

引用

@article{arxiv.2405.07031,
  title  = {Global Motion Understanding in Large-Scale Video Object Segmentation},
  author = {Volodymyr Fedynyak and Yaroslav Romanus and Oles Dobosevych and Igor Babin and Roman Riazantsev},
  journal= {arXiv preprint arXiv:2405.07031},
  year   = {2024}
}