谱引导多粒度指代视频对象分割
计算机视觉与模式识别
2023-07-26 v1 人工智能
多媒体
摘要
当前指代视频对象分割(R-VOS)技术从编码的(低分辨率)视觉-语言特征中提取条件核以分割解码的高分辨率特征。我们发现这导致显著的特征漂移,分割核在前向计算中难以感知。这对分割核的能力产生负面影响。为解决漂移问题,我们提出谱引导多粒度(SgMg)方法,其在编码特征上直接分割并借助视觉细节进一步优化掩码。此外,我们提出谱引导跨模态融合(SCF)以在谱域执行帧内全局交互,从而获得有效的多模态表示。最后,我们将SgMg扩展以执行多对象R-VOS,这是一种新范式,可同时分割视频中多个被指代对象。这不仅使R-VOS更快,也更实用。大量实验表明SgMg在四个视频基准数据集上达到最先进性能,在Ref-YouTube-VOS上以2.8%的优势超越最近竞争者。我们扩展的SgMg支持多对象R-VOS,运行速度约快3倍且保持满意性能。代码见 https://github.com/bo-miao/SgMg。
引用
@article{arxiv.2307.13537,
title = {Spectrum-guided Multi-granularity Referring Video Object Segmentation},
author = {Bo Miao and Mohammed Bennamoun and Yongsheng Gao and Ajmal Mian},
journal= {arXiv preprint arXiv:2307.13537},
year = {2023}
}
备注
Accepted by ICCV 2023, code is at https://github.com/bo-miao/SgMg