中文

通过视频图Transformer的对比式视频问答

计算机视觉与模式识别 2023-07-12 v2 多媒体

摘要

我们提出以对比方式通过视频图Transformer模型(CoVGT)执行视频问答(VideoQA)。CoVGT的独特性和优越性体现在三方面:1)提出动态图Transformer模块,通过显式捕获视觉对象、其关系及动态来编码视频,以进行复杂的时空推理。2)设计分离的视频与文本Transformer用于视频与文本间的对比学习以执行QA,而非使用多模态Transformer进行答案分类。细粒度视频-文本通信由额外的跨模态交互模块完成。3)通过对正确与错误答案之间以及相关与不相关问题之间分别进行联合全监督与自监督对比目标来优化。凭借优越的视频编码与QA方案,我们表明CoVGT在视频推理任务上可比以往方法取得好得多的性能。其性能甚至超越那些用数百万外部数据预训练的模型。我们进一步表明CoVGT也可从跨模态预训练中获益,但所需数据量少几个数量级。结果展示了CoVGT的有效性与优越性,并额外揭示了其更具数据效率预训练的潜力。我们希望我们的成功能推动VideoQA从粗粒度识别/描述迈向视频内容的细粒度关系推理。我们的代码见于https://github.com/doc-doc/CoVGT。

关键词

引用

@article{arxiv.2302.13668,
  title  = {Contrastive Video Question Answering via Video Graph Transformer},
  author = {Junbin Xiao and Pan Zhou and Angela Yao and Yicong Li and Richang Hong and Shuicheng Yan and Tat-Seng Chua},
  journal= {arXiv preprint arXiv:2302.13668},
  year   = {2023}
}

备注

Accepted by IEEE T-PAMI'23