一段视频是否等价于$n\times n$张图像?一种基于Transformer的高效视频问答方法
计算机视觉与模式识别
2023-05-17 v1 人工智能
计算与语言
多媒体
摘要
传统的基于Transformer的视频问答(VideoQA)方法通常通过一个或多个图像编码器独立编码帧,随后进行帧与问题之间的交互。然而,这种架构会导致显著的内存占用,并不可避免地拖慢训练和推理速度。本工作中,我们提出一种基于现有视觉-语言预训练模型的高效VideoQA方法,将视频帧拼接为矩阵并转换为一张图像。通过这种方式,我们将图像编码器的使用从次减少到次,同时保留原始视频的时间结构。在MSRVTT和TrafficQA上的实验结果表明,我们所提方法以近的速度提升和仅30%的内存占用达到了最先进的性能。我们表明,通过将我们的方法集成到VideoQA系统中,可以以显著的训练与推理加速获得可比甚至更优的性能。我们相信所提方法能够通过降低计算需求来促进VideoQA相关研究,惠及那些预算和资源有限的研究者。我们的代码将公开供研究使用。
引用
@article{arxiv.2305.09107,
title = {Is a Video worth $n\times n$ Images? A Highly Efficient Approach to Transformer-based Video Question Answering},
author = {Chenyang Lyu and Tianbo Ji and Yvette Graham and Jennifer Foster},
journal= {arXiv preprint arXiv:2305.09107},
year = {2023}
}