Click2Graph:来自单个点击的交互式全景视频场景图
信号处理
2025-11-21 v1
摘要
最先进的视频场景图生成(VSGG)系统提供结构化的视觉理解,但以封闭式、前馈管道形式运行,无法纳入人类指导。相比之下,面向用户交互的分割模型如SAM2能够实现精确的用户交互,但缺乏语义或关系推理。我们引入Click2Graph,这是第一个用于全景视频场景图生成(PVSG)的交互式框架,将视觉提示与空间、时间和语义理解统一起来。从单个用户线索(如点击或边界框)开始,Click2Graph对主题在时间上的分割和跟踪,自动发现交互对象,并预测<主题、客体、谓词>三元组,以形成在时间上一致的场景图。我们的框架引入了两个关键组件:一个动态交互发现模块,用于生成主题条件下的客体提示,以及一个语义分类头,用于联合实体和谓词推理。在OpenPVSG基准上的实验表明,Click2Graph为用户引导的PVSG建立了强大的基础,展示了如何将人类提示与全景定位和关系推理结合,以实现可控且可解释的视频场景理解。
引用
@article{arxiv.2511.15947,
title = {Integrated Coexistence for Satellite and Terrestrial Networks with Multistatic ISAC},
author = {Jeongju Jee and Jeffrey G. Andrews},
journal= {arXiv preprint arXiv:2511.15947},
year = {2025}
}