中文

基于迭代视频-文本协同分词的视频问答方法

计算机视觉与模式识别 2022-08-02 v1

摘要

视频问答是一项具有挑战性的任务,需要联合理解语言输入、单个视频帧中的视觉信息以及关于视频中事件发生的时间信息。在本文中,我们提出了一种用于视频问答的新型多流视频编码器,该编码器利用多路视频输入以及一种新的视频-文本迭代协同分词方法来回答与视频相关的各类问题。我们在 MSRVTT-QA、MSVD-QA、IVQA 等多个数据集上对所提模型进行了实验评估,以大幅优势超越了先前的 SOTA。同时,我们的模型将所需 GFLOPs 从 150-360 降低至仅 67,构建出高效的视频问答模型。

关键词

引用

@article{arxiv.2208.00934,
  title  = {Video Question Answering with Iterative Video-Text Co-Tokenization},
  author = {AJ Piergiovanni and Kairo Morton and Weicheng Kuo and Michael S. Ryoo and Anelia Angelova},
  journal= {arXiv preprint arXiv:2208.00934},
  year   = {2022}
}

备注

ECCV 2022