中文

面向视频问答的关系感知分层注意力框架

计算机视觉与模式识别 2021-05-17 v2 人工智能

摘要

视频问答(VideoQA)是一项颇具挑战的视频理解任务,因其需要对问题和视频的深层理解。以往研究主要聚焦于提取精细的视觉与语言嵌入,并通过精巧的手动设计网络进行融合。然而,不同帧、物体及模态与问题的相关性随时间变化,这一点在大多数现有方法中被忽略。缺乏对物体间动态关系与交互的理解给 VideoQA 任务带来了巨大挑战。为解决这个问题,我们提出了一种新颖的关系感知分层注意力(RHA)框架,以学习视频中物体的静态与动态关系。具体而言,首先通过预训练模型嵌入视频和问题,获得视觉与文本特征。随后利用基于图的关系编码器提取视觉物体间的静态关系。为捕捉不同视频帧中多模态物体的动态变化,我们考虑时间、空间与语义关系,并通过分层注意力机制融合多模态特征以预测答案。我们在大规模 VideoQA 数据集上进行了充分实验,实验结果表明我们的 RHA 优于当前最优方法。

关键词

引用

@article{arxiv.2105.06160,
  title  = {Relation-aware Hierarchical Attention Framework for Video Question Answering},
  author = {Fangtao Li and Ting Bai and Chenyu Cao and Zihe Liu and Chenghao Yan and Bin Wu},
  journal= {arXiv preprint arXiv:2105.06160},
  year   = {2021}
}

备注

9 pages, This paper is accepted by ICMR 2021