MIST:面向长视频问答的多模态迭代时空Transformer
计算机视觉与模式识别
2022-12-20 v1
摘要
要构建能够辅助人类日常活动的视频问答(VideoQA)系统,从包含多样且复杂事件的长视频中寻找答案是必不可少的。现有的多模态VQA模型在图像或短视频片段上取得了令人瞩目的性能,尤其是在近期大规模多模态预训练取得成功的背景下。然而,将这些方法扩展到长视频时,新的挑战随之出现。一方面,使用密集视频采样策略在计算上代价过高。另一方面,依赖稀疏采样的方法在需要多事件和多粒度视觉推理的场景中表现不佳。在这项工作中,我们引入了一个名为多模态迭代时空Transformer(MIST)的新模型,以更好地将预训练模型适配于长视频问答。具体而言,MIST将传统的密集时空自注意力分解为级联的片段和区域选择模块,这些模块自适应地选择与问题本身密切相关的帧和图像区域。然后,通过一个注意力模块高效地处理不同粒度的视觉概念。此外,MIST在多个层上迭代进行选择和注意力操作,以支持对多个事件的推理。在四个VideoQA数据集(包括AGQA、NExT-QA、STAR和Env-QA)上的实验结果表明,MIST达到了最先进的性能,并且在计算效率和可解释性方面表现优越。
引用
@article{arxiv.2212.09522,
title = {MIST: Multi-modal Iterative Spatial-Temporal Transformer for Long-form Video Question Answering},
author = {Difei Gao and Luowei Zhou and Lei Ji and Linchao Zhu and Yi Yang and Mike Zheng Shou},
journal= {arXiv preprint arXiv:2212.09522},
year = {2022}
}