中文

野生环境下的指涉视频对象分割:展示何时何处

计算机视觉与模式识别 2026-03-17 v1

摘要

指涉视频对象分割(RVOS)近期因其广泛应用而备受关注。现有 RVOS 设置包含精心修剪的视频,文本指称对象始终出现在所有帧中,但这未能完全反映该任务的真实挑战。这种简化设置要求 RVOS 方法仅预测对象所在位置,无需显示对象出现的时机。本文引入面向野生环境的 RVOS 新设定。为此,我们收集了一个新的基准数据集,采用 YouTube 未剪裁视频构建,命名为 YoURVOS,包含 1,120 个野生视频,时长和场景数均是现有数据集的 7 倍。我们的新基准挑战 RVOS 方法不仅要显示对象所在位置,还要显示对象出现的时机。为建立基线,我们提出了对象级多模态转换器(OMFormer),通过对对象级多模态交互进行编码,以实现高效的全局时空定位。我们展示了现有 VOS 方法在我们的 YoURVOS 基准上难以胜任,尤其是在目标缺失帧数量增加时,而我们的 OMFormer 能稳健地表现。我们的 YoURVOS 数据集提供了一个必需的基准,将推动 RVOS 方法为实际应用的进步。

关键词

引用

@article{arxiv.2603.14300,
  title  = {Show Me When and Where: Towards Referring Video Object Segmentation in the Wild},
  author = {Mingqi Gao and Jinyu Yang and Jingnan Luo and Xiantong Zhen and Jungong Han and Giovanni Montana and Feng Zheng},
  journal= {arXiv preprint arXiv:2603.14300},
  year   = {2026}
}