中文

MeViS 竞赛第 3 名解答:基于运动表达的视频分割

计算机视觉与模式识别 2024-06-10 v1

摘要

指涉式视频对象分割(RVOS)依赖于自然语言表达式对视频中的目标对象进行分割,强调对文本-视频密集关系的建模。当前 RVOS 方法通常将独立预训练的视觉和语言模型作为主干,导致视频与文本之间存在显著的领域差距。在跨模态特征交互过程中,文本特征仅用作查询初始化,未能充分利用文本中的重要信息。本文提出使用冻结预训练视觉-语言模型(VLM)作为主干,特别强化跨模态特征交互。首先,我们使用冻结卷积 CLIP 主干生成对齐的视觉和文本特征,缓解领域差距问题并降低训练成本。其次,我们在管道中添加更多跨模态特征融合,以增强多模态信息的利用。进一步,我们提出一种新颖的视频查询初始化方法,以生成更高质量的视频查询。无需任何花哨技巧,我们的方法在 MeViS 测试集上取得 51.5 的 J&F 分数,并在 CVPR 2024 PVUW 工作坊的 MeViS 轨道中获得第三名。

关键词

引用

@article{arxiv.2406.04842,
  title  = {3rd Place Solution for MeViS Track in CVPR 2024 PVUW workshop: Motion Expression guided Video Segmentation},
  author = {Feiyu Pan and Hao Fang and Xiankai Lu},
  journal= {arXiv preprint arXiv:2406.04842},
  year   = {2024}
}