中文

以语言作为查询的参考视频对象分割

计算机视觉与模式识别 2022-03-15 v2

摘要

参考视频对象分割(R-VOS)是一项新兴的跨模态任务,旨在分割视频所有帧中由语言表达式所指代的目标对象。在本工作中,我们提出了一个基于 Transformer 构建的简洁统一框架,称为 ReferFormer。它将语言视为查询,并直接关注视频帧中最相关的区域。具体而言,我们引入一组以语言为条件的小规模对象查询作为 Transformer 的输入。通过这种方式,所有查询都只负责寻找所指代的对象。它们最终被转换为捕获关键对象级信息的动态卷积核,并充当卷积滤波器从特征图中生成分割掩码。对象跟踪通过跨帧关联相应查询自然实现。该机制极大简化了流程,且这一端到端框架与此前的方法有显著不同。在 Ref-Youtube-VOS、Ref-DAVIS17、A2D-Sentences 和 JHMDB-Sentences 上的大量实验表明了 ReferFormer 的有效性。在 Ref-Youtube-VOS 上,ReferFormer 以 ResNet-50 骨干网络在无需额外技巧的情况下取得了 55.6 J&F,超过此前最优性能 8.4 个点。此外,借助强大的 Swin-Large 骨干网络,ReferFormer 在所有现有方法中取得了 64.2 的最佳 J&F。而且,我们在 A2D-Sentences 和 JHMDB-Sentences 上分别展示了 55.0 mAP 和 43.7 mAP 的出色结果,大幅优于此前的方法。代码已公开于 https://github.com/wjn922/ReferFormer。

关键词

引用

@article{arxiv.2201.00487,
  title  = {Language as Queries for Referring Video Object Segmentation},
  author = {Jiannan Wu and Yi Jiang and Peize Sun and Zehuan Yuan and Ping Luo},
  journal= {arXiv preprint arXiv:2201.00487},
  year   = {2022}
}

备注

14 pages, accepted by CVPR2022