中文

用于视频问答的(2.5+1)D时空场景图

计算机视觉与模式识别 2022-03-29 v2 人工智能 机器学习

摘要

针对视频问答(QA)等基于视频推理任务的时空场景图方法,通常为每一帧视频构建此类图。这些方法往往忽略了视频本质上是3D空间中发生事件的2D“视图”序列,因此3D场景的语义可以在帧间传递。利用这一洞察,我们提出一种(2.5+1)D场景图表示,以更好地捕捉视频内部的时空信息流。具体而言,我们首先使用现成的2D到3D转换模块将每一2D帧转换为具有推断3D结构的2.5D(伪3D)场景图,随后将视频帧配准到共享的(2.5+1)D时空空间中,并将每个2D场景图嵌入其中。然后,将这种(2.5+1)D图划分为静态子图和动态子图,对应于其中的对象在世界中是否通常移动。动态图中的节点丰富了运动特征,以捕捉其与其他图节点的交互。接下来,针对视频QA任务,我们提出了一种基于Transformer的推理管线,将(2.5+1)D图嵌入到时空分层潜在空间中,其中子图及其交互以不同的粒度被捕捉。为了证明我们方法的有效性,我们在NExT-QA和AVSD-QA数据集上进行了实验。结果表明,我们提出的(2.5+1)D表示带来了更快的训练和推理速度,同时我们的分层模型在视频QA任务上展现出优于SOTA的性能。

关键词

引用

@article{arxiv.2202.09277,
  title  = {(2.5+1)D Spatio-Temporal Scene Graphs for Video Question Answering},
  author = {Anoop Cherian and Chiori Hori and Tim K. Marks and Jonathan Le Roux},
  journal= {arXiv preprint arXiv:2202.09277},
  year   = {2022}
}

备注

Accepted at AAAI 2022 (Oral)