面向故事化视频理解的协同注意力 Transformer 模型
计算机视觉与模式识别
2020-10-28 v1 人工智能
计算与语言
摘要
受视觉与语言学习近期趋势的启发,我们探索注意力机制在视觉-语言融合中的应用,并将其应用于故事化视频理解。与其他基于视频的问答任务类似,视频故事理解要求智能体把握复杂的时间依赖关系。然而,由于聚焦于视频的叙事层面,它还需要理解不同角色之间的交互,以及他们的行为及其动机。我们提出一种新颖的协同注意力 Transformer 模型,以更好地捕捉在如剧集等视觉故事中出现的长期依赖,并衡量其在视频问答任务上的性能。我们在近期推出的 DramaQA 数据集上评估我们的方法,该数据集以角色为中心的视频故事理解问题为特色。我们的模型在总体上比基线模型高出 8 个百分点,在所有难度级别上至少高出 4.95 个百分点、最高达 12.8 个百分点,并成功击败了 DramaQA 挑战赛的冠军。
引用
@article{arxiv.2010.14104,
title = {Co-attentional Transformers for Story-Based Video Understanding},
author = {Björn Bebensee and Byoung-Tak Zhang},
journal= {arXiv preprint arXiv:2010.14104},
year = {2020}
}
备注
10 pages, 2 figures, submitted to ICASSP 2021