面向视频问答的关系感知分层注意力框架
计算机视觉与模式识别
2021-05-17 v2 人工智能
摘要
视频问答(VideoQA)是一项颇具挑战的视频理解任务,因其需要对问题和视频的深层理解。以往研究主要聚焦于提取精细的视觉与语言嵌入,并通过精巧的手动设计网络进行融合。然而,不同帧、物体及模态与问题的相关性随时间变化,这一点在大多数现有方法中被忽略。缺乏对物体间动态关系与交互的理解给 VideoQA 任务带来了巨大挑战。为解决这个问题,我们提出了一种新颖的关系感知分层注意力(RHA)框架,以学习视频中物体的静态与动态关系。具体而言,首先通过预训练模型嵌入视频和问题,获得视觉与文本特征。随后利用基于图的关系编码器提取视觉物体间的静态关系。为捕捉不同视频帧中多模态物体的动态变化,我们考虑时间、空间与语义关系,并通过分层注意力机制融合多模态特征以预测答案。我们在大规模 VideoQA 数据集上进行了充分实验,实验结果表明我们的 RHA 优于当前最优方法。
引用
@article{arxiv.2105.06160,
title = {Relation-aware Hierarchical Attention Framework for Video Question Answering},
author = {Fangtao Li and Ting Bai and Chenyu Cao and Zihe Liu and Chenghao Yan and Bin Wu},
journal= {arXiv preprint arXiv:2105.06160},
year = {2021}
}
备注
9 pages, This paper is accepted by ICMR 2021