中文

OnlineRefer:一种用于指代视频对象分割的简单在线基线

计算机视觉与模式识别 2023-07-19 v1

摘要

指代视频对象分割(RVOS)旨在根据人类指令分割视频中的对象。当前最先进的方法属于离线模式,其中每个片段独立地与文本嵌入交互以实现跨模态理解。它们通常认为离线模式对 RVOS 是必要的,但在每个片段内建模的时间关联有限。在本工作中,我们打破了先前的离线观念,提出了一种简单而有效的使用显式查询传播的在线模型,称为 OnlineRefer。具体而言,我们的方法利用收集语义信息和位置先验的目标线索,来提高当前帧指代预测的准确性和易用性。此外,我们将在线模型推广为半在线框架,以兼容基于视频的骨干网络。为展示方法的有效性,我们在四个基准上进行了评估,即 Refer-Youtube-VOS、Refer-DAVIS17、A2D-Sentences 和 JHMDB-Sentences。无需额外技巧,我们的带有 Swin-L 骨干的 OnlineRefer 在 Refer-Youtube-VOS 和 Refer-DAVIS17 上分别取得了 63.5 J&F 和 64.8 J&F,优于所有其他离线方法。

关键词

引用

@article{arxiv.2307.09356,
  title  = {OnlineRefer: A Simple Online Baseline for Referring Video Object Segmentation},
  author = {Dongming Wu and Tiancai Wang and Yuang Zhang and Xiangyu Zhang and Jianbing Shen},
  journal= {arXiv preprint arXiv:2307.09356},
  year   = {2023}
}

备注

Accepted by ICCV2023. The code is at https://github.com/wudongming97/OnlineRefer