中文

用于视频问答的多尺度采样多级层次网络

计算机视觉与模式识别 2022-05-10 v1 人工智能

摘要

视频问答(VideoQA)因其视觉理解与自然语言处理的多模态结合而具有挑战性。虽然大多数现有方法忽略了不同时间尺度下的视觉表观—运动信息,但如何将深度学习模型的多级处理能力与该多尺度信息结合仍属未知。针对这些问题,本文提出一种新颖的用于 VideoQA 的带多尺度采样的多级层次网络(MHN)。MHN 包含两个模块,即循环多模态交互(RMI)和并行视觉推理(PVR)。通过多尺度采样,RMI 在每个尺度上迭代表观—运动信息与问题嵌入的交互,以构建多级问题引导的视觉表示。在此基础上,PVR 使用共享的 transformer 编码器并行推断每个层级的视觉线索,以适配回答可能依赖相关层级视觉信息的不同类型问题。通过在三个 VideoQA 数据集上的大量实验,我们展示了优于先前 SOTA 的性能,并验证了方法中各部分的的有效性。

关键词

引用

@article{arxiv.2205.04061,
  title  = {Multilevel Hierarchical Network with Multiscale Sampling for Video Question Answering},
  author = {Min Peng and Chongyang Wang and Yuan Gao and Yu Shi and Xiang-Dong Zhou},
  journal= {arXiv preprint arXiv:2205.04061},
  year   = {2022}
}

备注

Accepted by IJCAI 2022. arXiv admin note: text overlap with arXiv:2109.04735