Long-RVOS:面向长期 Referring Video Object Segmentation 的综合基准
计算机视觉与模式识别
2025-10-29 v2
摘要
Referring video object segmentation (RVOS) 旨在基于语言描述识别、跟踪和分割视频中的对象,近年来受到广泛关注。然而,现有数据集仅聚焦于持续数秒的短视频片段,目标物体在大多数帧中均可见。为推动该任务朝更实际的场景发展,本文引入了 Long-RVOS,一个规模庞大的长期 Referring Video Object Segmentation 基准。Long-RVOS 包含 2000 多个时长超过 60 秒的视频,覆盖经遮挡、消失-重现及镜头切换的多种对象。对象标注包含三种不同类型的描述,以分别评估对静态属性、运动模式和时空关系理解的能力。此外,与以往仅依赖逐帧空间评估的基准不同,本文引入两种新指标来评估时序一致性和时空一致性。我们在 Long-RVOS 上对 6 种最新方法进行基准测试,结果显示当前方法在面对长视频挑战时严重受限。为此,我们进一步提出 ReferMo,一种具有竞争基线的方法,通过整合运动信息扩大时序感受野,采用局部到全局架构捕获短期动态和长期依赖。尽管方法简单,ReferMo 在长期场景中相较于当前方法实现了显著提升。我们期望 Long-RVOS 及本基线能推动未来 RVOS 研究朝着更真实和长时段视频方向发展。
引用
@article{arxiv.2505.12702,
title = {Long-RVOS: A Comprehensive Benchmark for Long-term Referring Video Object Segmentation},
author = {Tianming Liang and Haichao Jiang and Yuting Yang and Chaolei Tan and Shuai Li and Wei-Shi Zheng and Jian-Fang Hu},
journal= {arXiv preprint arXiv:2505.12702},
year = {2025}
}
备注
Project Page: \url{https://isee-laboratory.github.io/Long-RVOS}