使用 LR/RL LSTMs 与时空注意力的视频填空
计算机视觉与模式识别
2017-04-18 v1
摘要
给定一个视频和一句带有一个缺失词的描述句子(我们称之为“源句子”),视频填空(VFIB)问题是自动找出该缺失词。句子的上下文信息以及来自视频的视觉线索对于准确推断缺失词十分重要。由于源句子被拆分为两个片段:句子的左片段(空白前)和句子的右片段(空白后),传统的循环神经网络无法精确编码此结构,因为缺失词在源句子中的位置与词性存在多种可能变化。例如,缺失词可以是首个词或位于句子中间,且可以是动词或形容词。本文中,我们提出一种框架来解决文本编码问题:采用两个独立的 LSTM(LR 与 RL LSTMs)分别编码左、右句子片段,并引入一种新颖结构将每个片段与对应于相反片段的“外部记忆”相结合。对于视觉编码,采用端到端的空间与时间注意力模型来选择有判别性的视觉表示以找到缺失词。实验中,我们在具有挑战性的 VFIB 问题上展示了所提方法的优越性能。此外,我们引入了 VFIB 的一个扩展且更通用的版本,其不限于单个空白。我们的实验表明了该方法在处理此类更真实场景时的泛化能力。
引用
@article{arxiv.1704.04689,
title = {Video Fill In the Blank using LR/RL LSTMs with Spatial-Temporal Attentions},
author = {Amir Mazaheri and Dong Zhang and Mubarak Shah},
journal= {arXiv preprint arXiv:1704.04689},
year = {2017}
}