中文

基于混合记忆的时间一致指代视频目标分割

计算机视觉与模式识别 2024-10-14 v2

摘要

指代视频目标分割(R-VOS)方法由于时间上下文的可变性以及其他视觉相似目标的存在,在保持一致的目标分割方面面临挑战。我们提出了一种端到端 R-VOS 范式,在指代分割的同时显式地对时间实例一致性进行建模。具体而言,我们引入了一种新颖的混合记忆,以促进帧间协作,从而实现稳健的时空匹配与传播。将自动生成高质量参考掩膜的帧特征基于多粒度关联进行传播,以分割剩余帧,从而实现时间一致的 R-VOS。此外,我们提出了一种新的掩膜一致性分数(MCS)指标来评估视频分割的时间一致性。大量实验表明,我们的方法显著提升了时间一致性,在流行的 R-VOS 基准测试上取得了顶尖性能,即 Ref-YouTube-VOS(67.1%)和 Ref-DAVIS17(65.6%)。代码可在 https://github.com/bo-miao/HTR 获取。

关键词

引用

@article{arxiv.2403.19407,
  title  = {Temporally Consistent Referring Video Object Segmentation with Hybrid Memory},
  author = {Bo Miao and Mohammed Bennamoun and Yongsheng Gao and Mubarak Shah and Ajmal Mian},
  journal= {arXiv preprint arXiv:2403.19407},
  year   = {2024}
}