中文

面向复杂组合推理的稠密而高效的视频问答方法

计算机视觉与模式识别 2022-10-20 v1

摘要

众所周知,大多数传统的视频问答(VideoQA)数据集由只需简单推理过程的简单问题构成。然而,长视频不可避免地沿时空轴包含复杂且组合性的语义结构,这要求模型理解视频中固有的组合结构。本文提出一种基于Transformer架构并带有可变形注意力机制的新组合式VideoQA方法,以应对复杂的VideoQA任务。引入可变形注意力从稠密视觉特征图中采样一组有信息的视觉特征,以高效覆盖时间上较长范围的帧。此外,复杂问句中的依赖结构也与语言嵌入相结合,以便轻松理解问题词之间的关系。大量实验与消融研究表明,所提出的稠密而高效的模型优于其他基线。

关键词

引用

@article{arxiv.2210.10300,
  title  = {Dense but Efficient VideoQA for Intricate Compositional Reasoning},
  author = {Jihyeon Lee and Wooyoung Kang and Eun-Sol Kim},
  journal= {arXiv preprint arXiv:2210.10300},
  year   = {2022}
}

备注

Accepted to WACV'23