基于融合 LSTM 的视频填空
计算机视觉与模式识别
2016-10-14 v1
摘要
给定一个视频及其带有缺失词的不完整文本描述,视频填空 (ViFitB) 任务是自动找到缺失的词。句子的上下文信息对于推断缺失词很重要;视觉线索对于获得更准确的推断更为关键。在本文中,我们提出了一种新方法,该方法直观地利用了句子的结构,并采用融合 LSTM(融合两个 LSTM)来解决嵌入文本和视觉线索的问题。在实验中,我们在具有挑战性的“Movie Fill-in-the-Blank”数据集上展示了所提方法的优越性能。
引用
@article{arxiv.1610.04062,
title = {Video Fill in the Blank with Merging LSTMs},
author = {Amir Mazaheri and Dong Zhang and Mubarak Shah},
journal= {arXiv preprint arXiv:1610.04062},
year = {2016}
}
备注
for Large Scale Movie Description and Understanding Challenge (LSMDC) 2016, "Movie fill-in-the-blank" Challenge, UCF_CRCV