中文

面向开放词汇视频实例分割的统一嵌入对齐

计算机视觉与模式识别 2024-07-15 v2

摘要

开放词汇视频实例分割 (VIS) 正因其能够对任意对象进行分割和跟踪而受到日益关注。然而,近期的开放词汇 VIS 尝试往往在 novel 类别的 generalisation 能力上表现不佳。我们发现,VLM 特征 (如 CLIP) 与 instance queries 之间的 domain gap 以及对时序一致性的利用不足是两个核心原因。为缓解这些问题,我们设计并训练了一种新的开放词汇 VIS 基线方法,称为 OVFormer。OVFormer 使用轻量级模块实现 query 嵌入与 CLIP 图像嵌入之间的统一嵌入对齐,以补偿 domain gap。不同于以往基于图像的训练方法,我们进行基于视频的模型训练,并部署准线上推理方案,充分挖掘视频中的时序一致性。OVFormer 无需任何特殊技巧,即可在以 ResNet-50 为 backbone 的 LV-VIS 上实现 21.9 mAP,超越前一最佳结果 7.7。在一些 Close-Vocabulary VIS 数据集上进行大量实验也表明,OVFormer 在 zero-shot generalisation 能力强,在 YouTube-VIS 2019 上提升 7.6 mAP,在 OVIS 上提升 3.9 mAP。代码已公开于 https://github.com/fanghaook/OVFormer。

关键词

引用

@article{arxiv.2407.07427,
  title  = {Unified Embedding Alignment for Open-Vocabulary Video Instance Segmentation},
  author = {Hao Fang and Peng Wu and Yawei Li and Xinxin Zhang and Xiankai Lu},
  journal= {arXiv preprint arXiv:2407.07427},
  year   = {2024}
}

备注

ECCV 2024