中文

用于视频字幕生成的具有调整时间注意力的分层 LSTM

计算机视觉与模式识别 2017-06-06 v1

摘要

在使用基于注意力的编码器-解码器框架进行视频字幕生成方面已取得了近期进展。然而,大多数现有的解码器将注意力机制应用于每个生成的单词,包括视觉词(例如“gun”和“shooting”)和非视觉词(例如“the”、“a”)。然而,这些非视觉词可以在不考虑视觉信号或注意力的情况下使用自然语言模型轻松预测。对非视觉词施加注意力机制可能会产生误导并降低视频字幕生成的整体性能。为了解决这个问题,我们提出了一种具有调整时间注意力的分层 LSTM (hLSTMat) 方法用于视频字幕生成。具体而言,所提出的框架利用时间注意力来选择特定帧以预测相关词,而调整时间注意力则用于决定是依赖视觉信息还是语言上下文信息。此外,设计了分层 LSTM 以同时考虑低级视觉信息和高级语言上下文信息,以支持视频字幕的生成。为了证明我们提出的框架的有效性,我们在两个流行数据集:MSVD 和 MSR-VTT 上测试了我们的方法,实验结果表明我们的方法在这两个数据集上均优于 state-of-the-art 方法。

关键词

引用

@article{arxiv.1706.01231,
  title  = {Hierarchical LSTM with Adjusted Temporal Attention for Video Captioning},
  author = {Jingkuan Song and Zhao Guo and Lianli Gao and Wu Liu and Dongxiang Zhang and Heng Tao Shen},
  journal= {arXiv preprint arXiv:1706.01231},
  year   = {2017}
}