中文

用于多模态视频问答的分层条件关系网络

计算机视觉与模式识别 2021-01-05 v2 人工智能

摘要

视频问答(Video QA)在多个方面对建模者提出挑战。建模视频不仅需要为动态视觉通道构建时空模型,还需为字幕或音频等相关信息通道构建多模态结构。视频问答至少增加两层复杂性:在语言查询语境下为每个通道选择相关内容,以及组合时空概念与关系以回应查询。为满足这些需求,我们从两点洞见出发:(a) 内容选择与关系构建可联合封装进条件计算结构;(b) 视频长度结构可分层组合。针对 (a),本文引入一种通用可复用神经单元,称为条件关系网络(CRN),其以一组张量对象为输入,并转换为编码输入关系的一组新对象。CRN 的通用设计通过简单块堆叠,灵活容纳不同域的输入模态与条件特征,从而简化视频问答常见的复杂模型构建过程。基于此,我们通过引入用于视频问答的分层条件关系网络(HCRN)实现洞见 (b)。HCRN 主要旨在从组合性、层次性以及近远期关系方面,利用视频视觉内容及其伴随通道的内在属性。HCRN 以两种形式应用于视频问答:短形式(仅由视觉内容推理答案)与长形式(同时呈现字幕等关联信息)。我们的严格评估在 TGIF-QA 和 TVQA 等包含大规模真实世界数据集的成熟基准上显示出对 SOTA 的一致提升,证明了我们的 CRN 单元与 HCRN 在视频问答等复杂领域的强大能力。

关键词

引用

@article{arxiv.2010.10019,
  title  = {Hierarchical Conditional Relation Networks for Multimodal Video Question Answering},
  author = {Thao Minh Le and Vuong Le and Svetha Venkatesh and Truyen Tran},
  journal= {arXiv preprint arXiv:2010.10019},
  year   = {2021}
}

备注

Major extension of our CVPR'20 paper to handle long video with text. arXiv admin note: substantial text overlap with arXiv:2002.10698