Click2Graph:来自单个点击的交互式全景视频场景图
计算机视觉与模式识别
2025-11-26 v2
摘要
最先进的视频场景图生成 (VSGG) 系统提供结构化的视觉理解,但以封闭的、前馏的管道形式出现,无法融入人类指导。相比之下,promptable 分割模型如 SAM2 能够实现精确的用户交互,但缺乏语义或关系推理。我们引入 Click2Graph,首个用于全景视频场景图生成 (PVSG) 的交互式框架,将视觉提示与空间、时间和语义理解统一起来。从单个用户线索(如点击或边界框)开始,Click2Graph 对主题在时间上的分割和跟踪,自动发现交互对象,并预测 <subject, object, predicate> 三元组以形成一致的时序场景图。我们的框架引入两个关键组件:Dynamic Interaction Discovery 模块生成 subject 条件下的 object 提示,Semantic Classification Head 执行联合实体和谓词推理。在 OpenPVSG 数据集基准测试中,Click2Graph 表明如何为用户引导的 PVSG 建立强大的基础,显示出人类提示如何与全景 grounding 和关系推理结合,以实现可控且可解释的视频场景理解。
引用
@article{arxiv.2511.15948,
title = {Click2Graph: Interactive Panoptic Video Scene Graphs from a Single Click},
author = {Raphael Ruschel and Hardikkumar Prajapati and Awsafur Rahman and B. S. Manjunath},
journal= {arXiv preprint arXiv:2511.15948},
year = {2025}
}