中文

基于融合 LSTM 的视频填空

计算机视觉与模式识别 2016-10-14 v1

摘要

给定一个视频及其带有缺失词的不完整文本描述,视频填空 (ViFitB) 任务是自动找到缺失的词。句子的上下文信息对于推断缺失词很重要;视觉线索对于获得更准确的推断更为关键。在本文中,我们提出了一种新方法,该方法直观地利用了句子的结构,并采用融合 LSTM(融合两个 LSTM)来解决嵌入文本和视觉线索的问题。在实验中,我们在具有挑战性的“Movie Fill-in-the-Blank”数据集上展示了所提方法的优越性能。

关键词

引用

@article{arxiv.1610.04062,
  title  = {Video Fill in the Blank with Merging LSTMs},
  author = {Amir Mazaheri and Dong Zhang and Mubarak Shah},
  journal= {arXiv preprint arXiv:1610.04062},
  year   = {2016}
}

备注

for Large Scale Movie Description and Understanding Challenge (LSMDC) 2016, "Movie fill-in-the-blank" Challenge, UCF_CRCV