中文

一段视频是否等价于$n\times n$张图像?一种基于Transformer的高效视频问答方法

计算机视觉与模式识别 2023-05-17 v1 人工智能 计算与语言 多媒体

摘要

传统的基于Transformer的视频问答(VideoQA)方法通常通过一个或多个图像编码器独立编码帧,随后进行帧与问题之间的交互。然而,这种架构会导致显著的内存占用,并不可避免地拖慢训练和推理速度。本工作中,我们提出一种基于现有视觉-语言预训练模型的高效VideoQA方法,将视频帧拼接为n×nn\times n矩阵并转换为一张图像。通过这种方式,我们将图像编码器的使用从n2n^{2}次减少到11次,同时保留原始视频的时间结构。在MSRVTT和TrafficQA上的实验结果表明,我们所提方法以近4×4\times的速度提升和仅30%的内存占用达到了最先进的性能。我们表明,通过将我们的方法集成到VideoQA系统中,可以以显著的训练与推理加速获得可比甚至更优的性能。我们相信所提方法能够通过降低计算需求来促进VideoQA相关研究,惠及那些预算和资源有限的研究者。我们的代码将公开供研究使用。

关键词

引用

@article{arxiv.2305.09107,
  title  = {Is a Video worth $n\times n$ Images? A Highly Efficient Approach to Transformer-based Video Question Answering},
  author = {Chenyang Lyu and Tianbo Ji and Yvette Graham and Jennifer Foster},
  journal= {arXiv preprint arXiv:2305.09107},
  year   = {2023}
}