中文

将时间对齐用作指代视频对象分割的学习信号

计算机视觉与模式识别 2025-09-30 v2

摘要

指代视频对象分割(RVOS)旨在基于自然语言表达式对视频中的对象进行分割和跟踪,需在视觉内容与文本查询之间实现精确的对齐。然而,现有方法常因在训练时盲目采样帧数并对所有可见对象进行监督——不论其与表达式实际相关性——而导致语义对齐问题。我们识别出核心问题在于常规训练范式中缺乏显式的时间学习信号。为此,我们构建了基于具有挑战性的MeViS基准数据集的MeViS-M数据集,手动标注了每个对象被表达式指代的时段。这些标注提供了直接的、在语义上依托的监督信号,此前缺失。为利用该信号,我们提出了时空对齐学习(Temporally Grounded Learning, TGL)框架,直接将时间对齐纳入训练过程。该框架包含两个关键策略:首先,时刻引导双路径传播(Moment-guided Dual-path Propagation, MDP)通过解耦语言引导的相关时刻分割与其他时刻的语言无关传播,提升了对齐与跟踪效果;其次,对象级选择性监督(Object-level Selective Supervision, OSS)仅对每个训练片段中与表达式时空对齐的对象进行监督,从而减少语义噪声并强化语言条件化学习。大量实验表明,我们的TGL框架有效利用时间信号,在挑战性的MeViS基准上达成新的状态最佳成绩。我们将公开代码及MeViS-M数据集。

关键词

引用

@article{arxiv.2508.11955,
  title  = {Temporal Grounding as a Learning Signal for Referring Video Object Segmentation},
  author = {Seunghun Lee and Jiwan Seo and Jeonghoon Kim and Sungho Moon and Siwon Kim and Haeun Yun and Hyogyeong Jeon and Wonhyeok Choi and Jaehoon Jeong and Zane Durante and Sang Hyun Park and Sunghoon Im},
  journal= {arXiv preprint arXiv:2508.11955},
  year   = {2025}
}

备注

Project page: https://seung-hun-lee.github.io/projects/TGL/