中文

响应-G1:基于场景图的显式建模用于主动式流媒体视频理解

计算机视觉与模式识别 2026-05-12 v2 人工智能

摘要

主动式流媒体视频理解要求 Video-LLM 在视频展开过程中决定何时作出响应,而现有方法因对视觉证据的隐式、查询不敏感建模常常不足。我们引入 Response-G1,一个新框架,通过场景图建立 accumulated video evidence 与查询预期响应条件之间的显式、结构化对齐。该框架在三个无需微调的阶段中运行:(1) 从流式片段生成以查询为导向的场景图;(2) 基于记忆检索最语义相关的历史场景图;(3) 以检索增强触发提示进行逐帧 "沉默/响应" 决策。通过在共享图表示中对证据和条件进行 grounding,Response-G1 实现了更具可解释性和准确的响应时机决策。实验结果表明,在既定基准上的主动和反应性任务中,我们的方法具有优势,验证了显式场景图建模和检索在流式视频理解中的优势。

关键词

引用

@article{arxiv.2605.07575,
  title  = {Response-G1: Explicit Scene Graph Modeling for Proactive Streaming Video Understanding},
  author = {Ke Ma and Jiaqi Tang and Bin Guo and Xueting Han and Ruonan Xu and Qingfeng He and Ziheng Wang and Xu Wang and Qifeng Chen and Zhiwen Yu and Yunhao Liu},
  journal= {arXiv preprint arXiv:2605.07575},
  year   = {2026}
}

备注

Accepted to ACL 2026