中文

基于循环关系一致性的鲁棒指代视频对象分割

计算机视觉与模式识别 2023-08-22 v3

摘要

指代视频对象分割(R-VOS)是一项具有挑战性的任务,旨在基于语言表述分割视频中的对象。多数现有 R-VOS 方法有一个关键假设:所指对象必须出现在视频中。我们将该假设称为语义一致,其在真实场景中常被违背,此时表述可能针对错误视频被查询。本工作中,我们强调对能处理语义不匹配的鲁棒 R-VOS 模型的需求。相应地,我们提出一项称为鲁棒 R-VOS 的扩展任务,其接受未配对视频-文本输入。我们通过联合建模主 R-VOS 问题及其对偶(文本重建)来解决该问题。引入一种结构化文本到文本循环约束,以判别视频-文本对间的语义一致并在正样本对中施加之,从而从正负对中均实现多模态对齐。我们的结构约束有效应对了语言多样性带来的挑战,克服了先前依赖逐点约束方法的局限。构建了新评估数据集 R\textsuperscript{2}-Youtube-VOS 以度量模型鲁棒性。我们的模型在 R-VOS 基准 Ref-DAVIS17 与 Ref-Youtube-VOS 以及我们的 R\textsuperscript{2}-Youtube-VOS~数据集上均取得最先进性能。

关键词

引用

@article{arxiv.2207.01203,
  title  = {Towards Robust Referring Video Object Segmentation with Cyclic Relational Consensus},
  author = {Xiang Li and Jinglu Wang and Xiaohao Xu and Xiao Li and Bhiksha Raj and Yan Lu},
  journal= {arXiv preprint arXiv:2207.01203},
  year   = {2023}
}

备注

iccv 2023, https://github.com/lxa9867/R2VOS