中文

EventRR:面向指涉视频物体分割的事件Referential推理

计算机视觉与模式识别 2025-08-15 v2

摘要

指涉视频物体分割(RVOS)旨在分割由表达式指涉的视频中的物体。当前 RVOS 方法将指涉表达式视为无结构序列,忽略其对于指涉推理至关重要的语义结构。此外,与仅聚焦于物体属性和物体-物体关系的图像指涉表达式不同,视频指涉表达式还包含事件属性和事件-事件 时间关系。这种复杂性挑战了传统结构推理图像方法。本文提出 Event Referential Reasoning(EventRR)框架。EventRR 将 RVOS 解耦为对象摘要部分和指涉推理部分。摘要阶段首先将每个帧摘要为一组瓶颈 token,然后在视频级摘要步骤中高效聚合,以交换全局跨模态时间上下文。对于推理部分,EventRR 将视频指涉表达式的语义事件结构提取为高度表达的 Referential Event Graph(REG),它是一个单根的有向无环图。基于 REG 的拓扑遍历,我们提出 Temporal Concept-Role Reasoning(TCRR),以 REG 叶节点到根节点累积每个时间查询的指涉得分。每个推理步骤可解释为从 REG 中概念-角色关系派生的问答对。广泛的实验跨四个广泛认可的基准数据集显示,EventRR 在定量和定性方面超越了最先进的 RVOS 方法。代码已提供:https://github.com/bio-mlhui/EventRR

关键词

引用

@article{arxiv.2508.07171,
  title  = {EventRR: Event Referential Reasoning for Referring Video Object Segmentation},
  author = {Huihui Xu and Jiashi Lin and Haoyu Chen and Junjun He and Lei Zhu},
  journal= {arXiv preprint arXiv:2508.07171},
  year   = {2025}
}