中文

从自上而下视角重新审视指代视频对象分割中的跨模态交互

计算机视觉与模式识别 2024-01-22 v2

摘要

指代视频对象分割(RVOS)旨在以自然语言指代为引导分割视频对象。先前的方法通常通过直接在图像点阵上定位语言指代来解决 RVOS。这种自下而上的策略未能探索对象级线索,容易导致较差的结果。在这项工作中,我们转而提出一种两阶段、自上而下的 RVOS 解决方案。首先,通过将从若干采样帧检测到的对象掩码传播至整个视频,构建一组详尽的对象轨迹。其次,提出一种基于 Transformer 的轨迹-语言定位模块,其同时且高效地建模实例级视觉关系与跨模态交互。我们的模型在 CVPR2021 Referring Youtube-VOS 挑战赛上排名第一。

关键词

引用

@article{arxiv.2106.01061,
  title  = {Rethinking Cross-modal Interaction from a Top-down Perspective for Referring Video Object Segmentation},
  author = {Chen Liang and Yu Wu and Tianfei Zhou and Wenguan Wang and Zongxin Yang and Yunchao Wei and Yi Yang},
  journal= {arXiv preprint arXiv:2106.01061},
  year   = {2024}
}

备注

Champion solution in YouTube-VOS 2021 Track 3. Extended version published in https://ieeexplore.ieee.org/abstract/document/10083244