用于视频问答的具有多模态交互的时间金字塔 Transformer
计算机视觉与模式识别
2021-09-13 v1
摘要
鉴于视频问答(VideoQA)结合了视觉理解与自然语言理解的多模态特性,该任务具有较大挑战。现有方法很少利用视频中多个时间尺度上的外观-运动信息,且常常忽略问题与视觉信息之间的交互以提取文本语义。针对这些问题,本文提出了一种用于 VideoQA 的具有多模态交互的新型时间金字塔 Transformer(Temporal Pyramid Transformer, TPT)模型。TPT 模型包含两个模块,即特定问题 Transformer(Question-specific Transformer, QT)和视觉推断(Visual Inference, VI)。给定从视频构建的时间金字塔,QT 通过每个单词与视觉内容之间从粗到细的多模态共现来构建问题语义。在此类特定问题语义的指导下,VI 通过问题与视频之间从局部到全局的多级交互来推断视觉线索。在每个模块内,我们引入了多模态注意力机制以辅助提取问题-视频交互,并采用残差连接在不同层级之间传递信息。通过在三个 VideoQA 数据集上的大量实验,我们证明了所提方法相较于现有技术取得了更好的性能。
引用
@article{arxiv.2109.04735,
title = {Temporal Pyramid Transformer with Multimodal Interaction for Video Question Answering},
author = {Min Peng and Chongyang Wang and Yuan Gao and Yu Shi and Xiang-Dong Zhou},
journal= {arXiv preprint arXiv:2109.04735},
year = {2021}
}
备注
Submitted to AAAI'22