中文

解耦静态与层次运动感知用于指代视频分割

计算机视觉与模式识别 2024-04-05 v1

摘要

指代视频分割依赖自然语言表达式来识别和分割对象,常常强调运动线索。以往的工作将句子整体处理,并直接在视频级别进行识别,混合了静态图像级线索与时间运动线索。然而,图像级特征无法很好地理解句子中的运动线索,静态线索对于时间感知并不 crucial。事实上,静态线索有时会通过压倒运动线索来干扰时间感知。在本工作中,我们提出将视频级别的指代表达式理解解耦为静态与运动感知,特别强调增强时间理解。首先,我们引入表达式解耦模块,使静态线索和运动线索发挥各自独特作用,缓解句子嵌入忽略运动线索的问题。其次,我们提出层次运动感知模块,有效地跨越不同时间尺度捕获时间信息。此外,我们采用对比学习来区分视觉相似对象的运动。这些贡献在包括挑战性数据集 MeViS 在内的五个数据集上实现了状态-of-the-art 性能,其中在 MeViS 数据集上实现了显著的 9.2%\textbf{9.2\%} J&F\mathcal{J\&F} 改进。代码可在 https://github.com/heshuting555/DsHmp 获取。

关键词

引用

@article{arxiv.2404.03645,
  title  = {Decoupling Static and Hierarchical Motion Perception for Referring Video Segmentation},
  author = {Shuting He and Henghui Ding},
  journal= {arXiv preprint arXiv:2404.03645},
  year   = {2024}
}

备注

CVPR 2024, code: https://github.com/heshuting555/DsHmp