面向视频问答的 GHR-VQA:图指导的层次化关系推理
计算机视觉与模式识别
2025-11-26 v1
摘要
我们提出了GHR-VQA(Graph-guided Hierarchical Relational Reasoning for Video Question Answering,视频问答),是一个新型以人为中心的框架,融合场景图来捕捉视频序列中复杂的人物-物体互动。不同于传统的像素级方法,每个帧被表示为场景图,人物节点跨帧链接到全局根节点,形成视频级图,从而实现以人物演员为中心的跨帧推理。随后,对视频级图进行图神经网络(GNN)处理,将其转化为富有上下文感知的嵌入,以便高效处理。最后,这些嵌入与问题特征在不同抽象层次上的层次化网络中集成,增强了对视频内容的局部和全局理解。这种显式的人物-根节点结构通过分解人物-物体互动来增强可解释性,并促进对时空动态的深入理解。我们在 Action Genome Question Answering(AGQA)数据集上验证了我们的方案,实现了显著的性能提升,包括在对象关系推理方面相对于最先进方法提升了7.3%。
引用
@article{arxiv.2511.20201,
title = {GHR-VQA: Graph-guided Hierarchical Relational Reasoning for Video Question Answering},
author = {Dionysia Danai Brilli and Dimitrios Mallis and Vassilis Pitsikalis and Petros Maragos},
journal= {arXiv preprint arXiv:2511.20201},
year = {2025}
}