基于金字塔多模态 Transformer 的高效端到端视频问答
计算机视觉与模式识别
2023-03-07 v2
摘要
本文提出了一种用于端到端视频问答(VideoQA)的新方法,有别于当前使用大规模预训练和庞大特征提取器的流行趋势。我们通过一个金字塔多模态 Transformer(PMT)模型实现这一目标,该模型仅包含一个可学习的词嵌入层、少量卷积层和 Transformer 层。我们使用各向异性金字塔来实现跨不同时空尺度的视频-语言交互。除了包含自底向上和自顶向下通路及横向连接的经典金字塔外,我们还提出了新的策略,将视觉特征流在不同尺度上分解为空间和时间子流,并在保持局部和全局语义完整性的同时,实现它们与语言语义的交互。在五个 VideoQA 基准测试中,我们展示了与最先进方法相比更好或相当的性能,同时具有高计算效率。我们的消融研究显示了模型的可扩展性,通过利用具有可复用预训练权重的特征提取器,在文本到视频检索任务上取得了有竞争力的结果,同时也证明了金字塔结构的有效性。
引用
@article{arxiv.2302.02136,
title = {Efficient End-to-End Video Question Answering with Pyramidal Multimodal Transformer},
author = {Min Peng and Chongyang Wang and Yu Shi and Xiang-Dong Zhou},
journal= {arXiv preprint arXiv:2302.02136},
year = {2023}
}
备注
Accepted by AAAI 2023