基于事件关联的视频问答跨模态推理
计算机视觉与模式识别
2023-12-21 v1
摘要
视频问答(VideoQA)是一个极具吸引力且充满挑战的研究方向,旨在理解来自两个领域的异构数据的复杂语义,即时空视频内容和问题中的词序列。尽管各种注意力机制已被用于通过建模两种模态的模态内和模态间关系来管理上下文表示,但主流 VideoQA 方法的一个局限性是缺乏基于事件关联的推理,即感知和分析视频中包含的丰富且信息量大的事件之间的关系。在本文中,我们引入密集描述模态作为一种新的辅助手段,并从中提炼事件相关信息以推断正确答案。为此,我们提出了一种新颖的端到端可训练模型——事件关联图神经网络(EC-GNNs),以在三种模态(即描述、视频和问题)的信息上执行跨模态推理。除了利用一种全新的模态外,我们还采用跨模态推理模块来显式建模模态间关系并聚合不同模态的相关信息,并提出了一种问题引导的自适应多模态融合模块,通过多步推理收集面向问题且与事件相关的证据。我们在两个广泛使用的基准数据集上评估了我们的模型,并进行了消融研究以证明每个提出组件的有效性。
引用
@article{arxiv.2312.12721,
title = {Cross-Modal Reasoning with Event Correlation for Video Question Answering},
author = {Chengxiang Yin and Zhengping Che and Kun Wu and Zhiyuan Xu and Qinru Qiu and Jian Tang},
journal= {arXiv preprint arXiv:2312.12721},
year = {2023}
}