中文

面向视频问答的结构化双流注意力网络

计算机视觉与模式识别 2022-06-03 v1

摘要

迄今为止,视觉问答(VQA)(即图像 QA 与视频 QA)仍是视觉与语言理解中的难题,视频 QA 尤甚。与主要关注理解图像区域级细节与对应问题之间关联的图像 QA 相比,视频 QA 要求模型联合推理视频的空间与长程时间结构以及文本,以给出准确答案。本文通过提出一种结构化双流注意力网络(即 STA)专门解决视频 QA 问题,以回答关于给定视频内容的自由形式或开放式自然语言问题。首先,我们利用结构化片段组件推断视频中丰富的长程时间结构并编码文本特征。随后,我们的结构化双流注意力组件同时定位重要视觉实例、降低背景视频影响并聚焦于相关文本。最后,结构化双流融合组件整合查询与视频感知上下文表示的不同片段并推断答案。在大规模视频 QA 数据集 \textit{TGIF-QA} 上的实验表明,我们提出的方法在 Action、Trans.、TrameQA 和 Count 任务上分别以 13.0%、13.5%、11.0% 和 0.3 显著超越最佳同类方法(即视频输入单一表示);在 Action、Trans.、TrameQA 任务上也以 4.1%、4.7% 和 5.1% 优于最佳竞争方法(即双表示)。

关键词

引用

@article{arxiv.2206.01017,
  title  = {Structured Two-stream Attention Network for Video Question Answering},
  author = {Lianli Gao and Pengpeng Zeng and Jingkuan Song and Yuan-Fang Li and Wu Liu and Tao Mei and Heng Tao Shen},
  journal= {arXiv preprint arXiv:2206.01017},
  year   = {2022}
}