HyperGLM: 用于视频场景图生成与预测的超图
计算机视觉与模式识别
2025-04-01 v2
摘要
多模态大语言模型 (LLM) 在视觉语言任务方面取得了进展,但仍在理解视频场景方面存在挑战。为弥合这一差距,视频场景图生成 (VidSGG) 有望捕捉跨视频帧的多对象关系。然而,先前的方法依赖于二元连接,限制了其处理复杂多对象互动和推理的能力。为此,我们提出了将多模态 LLM 置于场景超图 (HyperGLM) 上,以促进对多向互动和高阶关系的推理。我们的方法独特地将实体场景图(捕捉对象之间的空间关系)与程序图(建模其因果转换)整合,形成统一的超图。显著的是,HyperGLM 通过将统一的超图注入 LLM 来实现推理。此外,我们引入了一个新的视频场景图推理 (VSGR) 数据集,包含来自第三方称视、第一人称和无人机视角的 190 万帧,并支持五个任务:场景图生成、场景图预测、视频问答、视频描述和关系推理。经验上,HyperGLM 在五个任务上 consistently 超过状态最佳方法,有效地建模和推理多样化视频场景中的复杂关系。
引用
@article{arxiv.2411.18042,
title = {HyperGLM: HyperGraph for Video Scene Graph Generation and Anticipation},
author = {Trong-Thuan Nguyen and Pha Nguyen and Jackson Cothren and Alper Yilmaz and Khoa Luu},
journal= {arXiv preprint arXiv:2411.18042},
year = {2025}
}