解耦静态与层次运动感知用于指代视频分割
计算机视觉与模式识别
2024-04-05 v1
摘要
指代视频分割依赖自然语言表达式来识别和分割对象,常常强调运动线索。以往的工作将句子整体处理,并直接在视频级别进行识别,混合了静态图像级线索与时间运动线索。然而,图像级特征无法很好地理解句子中的运动线索,静态线索对于时间感知并不 crucial。事实上,静态线索有时会通过压倒运动线索来干扰时间感知。在本工作中,我们提出将视频级别的指代表达式理解解耦为静态与运动感知,特别强调增强时间理解。首先,我们引入表达式解耦模块,使静态线索和运动线索发挥各自独特作用,缓解句子嵌入忽略运动线索的问题。其次,我们提出层次运动感知模块,有效地跨越不同时间尺度捕获时间信息。此外,我们采用对比学习来区分视觉相似对象的运动。这些贡献在包括挑战性数据集 MeViS 在内的五个数据集上实现了状态-of-the-art 性能,其中在 MeViS 数据集上实现了显著的 改进。代码可在 https://github.com/heshuting555/DsHmp 获取。
引用
@article{arxiv.2404.03645,
title = {Decoupling Static and Hierarchical Motion Perception for Referring Video Segmentation},
author = {Shuting He and Henghui Ding},
journal= {arXiv preprint arXiv:2404.03645},
year = {2024}
}
备注
CVPR 2024, code: https://github.com/heshuting555/DsHmp