中文

基于金字塔多模态 Transformer 的高效端到端视频问答

计算机视觉与模式识别 2023-03-07 v2

摘要

本文提出了一种用于端到端视频问答(VideoQA)的新方法,有别于当前使用大规模预训练和庞大特征提取器的流行趋势。我们通过一个金字塔多模态 Transformer(PMT)模型实现这一目标,该模型仅包含一个可学习的词嵌入层、少量卷积层和 Transformer 层。我们使用各向异性金字塔来实现跨不同时空尺度的视频-语言交互。除了包含自底向上和自顶向下通路及横向连接的经典金字塔外,我们还提出了新的策略,将视觉特征流在不同尺度上分解为空间和时间子流,并在保持局部和全局语义完整性的同时,实现它们与语言语义的交互。在五个 VideoQA 基准测试中,我们展示了与最先进方法相比更好或相当的性能,同时具有高计算效率。我们的消融研究显示了模型的可扩展性,通过利用具有可复用预训练权重的特征提取器,在文本到视频检索任务上取得了有竞争力的结果,同时也证明了金字塔结构的有效性。

关键词

引用

@article{arxiv.2302.02136,
  title  = {Efficient End-to-End Video Question Answering with Pyramidal Multimodal Transformer},
  author = {Min Peng and Chongyang Wang and Yu Shi and Xiang-Dong Zhou},
  journal= {arXiv preprint arXiv:2302.02136},
  year   = {2023}
}

备注

Accepted by AAAI 2023