中文

用于视频问答的视频图Transformer

计算机视觉与模式识别 2022-07-22 v3

摘要

本文提出一种用于视频问答(VideoQA)的Video Graph Transformer (VGT)模型。VGT的独特性有两点:1)设计了动态图Transformer模块,通过显式捕获视觉对象、其关系及动态来进行复杂时空推理以编码视频;2)利用解耦的视频与文本Transformer进行视频与文本间的相关性比较以执行QA,而非使用纠缠的跨模态Transformer进行答案分类。视觉-文本通信通过额外的跨模态交互模块完成。借助更合理的视频编码与QA方案,我们表明在无预训练场景下,VGT在挑战动态关系推理的VideoQA任务上可比先前方法取得远优性能。其性能甚至超越那些用数百万外部数据预训练的模型。我们进一步表明,VGT也能从自监督跨模态预训练中获益良多,但所需数据量少数个数量级。这些结果清晰展示了VGT的有效性与优越性,并揭示其在更高效数据预训练上的潜力。通过全面分析与一些启发式观察,我们希望VGT能推动VQA研究从粗粒度识别/描述走向真实视频中的细粒度关系推理。我们的代码见https://github.com/sail-sg/VGT。

关键词

引用

@article{arxiv.2207.05342,
  title  = {Video Graph Transformer for Video Question Answering},
  author = {Junbin Xiao and Pan Zhou and Tat-Seng Chua and Shuicheng Yan},
  journal= {arXiv preprint arXiv:2207.05342},
  year   = {2022}
}

备注

ECCV'22