时间约束下的视频推理分割与自动化基准构建
计算机视觉与模式识别
2025-07-23 v1
摘要
传统的视频分割方法局限于预定义的对象类别,无法识别词汇表外的对象,更不用说那些在复杂文本查询中未被明确识别而仅被隐含提及的对象。这一缺陷限制了视频分割在复杂多变场景中的实用性,在这些场景中,很难定义封闭的对象类别集,且用户可能不知道视频中将出现的精确对象类别。此类场景可能出现在手术室视频分析中,不同的医疗系统可能使用不同的工作流程和仪器,因此需要灵活的视频分析解决方案。推理分割(RS)现在为此类解决方案提供了希望,它允许使用自然语言文本查询作为交互方式来识别待分割对象。然而,现有的视频RS公式假设目标对象在整个视频序列中始终保持上下文相关性。这一假设对于现实世界场景是不充分的,在这些场景中,感兴趣的对象会根据时间上下文动态地出现、消失或改变其相关性,例如仅在特定手术阶段才相关的手术器械,或在手术特定时刻变得重要的解剖结构。我们的第一个贡献是引入了时间约束下的视频推理分割,这是一种新颖的任务公式,要求模型基于包含时间推理的文本查询,隐式推断目标对象何时变得上下文相关。由于手动标注时间约束的视频RS数据集成本高昂且会限制可扩展性,我们的第二个贡献是一种创新的自动化基准构建方法。最后,我们提出了TCVideoRSBenchmark,一个包含52个样本的时间约束视频RS数据集,这些样本使用了MVOR数据集中的视频。
引用
@article{arxiv.2507.16718,
title = {Temporally-Constrained Video Reasoning Segmentation and Automated Benchmark Construction},
author = {Yiqing Shen and Chenjia Li and Chenxiao Fan and Mathias Unberath},
journal= {arXiv preprint arXiv:2507.16718},
year = {2025}
}