用于视频问答的情境超图学习
计算机视觉与模式识别
2023-05-09 v2
摘要
回答视频中复杂情境的问题,不仅需要捕捉参与者、物体及其关系的存在,还需捕捉这些关系随时间的演化。情境超图是一种将情境描述为视频帧的场景子图、并以超边连接子图的表示,其被提出以紧凑结构化形式捕获所有此类信息。在本工作中,我们提出一种用于视频问答(VQA)的架构,通过预测情境超图来回答与视频内容相关的问题,称为基于情境超图的视频问答(SHG-VQA)。为此,我们训练一个情境超图解码器,从输入视频片段中隐式识别具有动作及物体/人-物关系的图表示,并利用预测的情境超图与问题嵌入之间的交叉注意力来预测正确答案。所提方法以端到端方式训练,并由带交叉熵函数的 VQA 损失与用于情境图预测的匈牙利匹配损失优化。所提架构的有效性在两个具挑战性的基准 AGQA 与 STAR 上进行了广泛评估。我们的结果表明,学习底层情境超图有助于系统显著提升其在视频问答任务新挑战上的表现。
引用
@article{arxiv.2304.08682,
title = {Learning Situation Hyper-Graphs for Video Question Answering},
author = {Aisha Urooj Khan and Hilde Kuehne and Bo Wu and Kim Chheu and Walid Bousselham and Chuang Gan and Niels Lobo and Mubarak Shah},
journal= {arXiv preprint arXiv:2304.08682},
year = {2023}
}