多面注意力视频字幕生成
计算机视觉与模式识别
2016-12-02 v1
摘要
近年来,视频字幕生成因其在提升无障碍性和信息检索方面的潜力而受到越来越多的关注。尽管现有方法依赖于不同种类的视觉特征和模型结构,但它们并未充分利用相关的语义信息。我们提出了一种可扩展的方法,以联合利用多种视觉特征和语义属性。我们的新颖架构基于LSTM进行句子生成,并带有若干注意力层与两个多模态层。注意力机制学习自动选择最显著的视觉特征或语义属性,而多模态层为句子生成组件的输入和输出提供整体表示。在具有挑战性的MSVD和MSR-VTT数据集上的实验结果表明,我们的框架优于最先进的方法,而基于真值(ground truth)的语义属性能够进一步提升输出质量至接近人类水平。
引用
@article{arxiv.1612.00234,
title = {Video Captioning with Multi-Faceted Attention},
author = {Xiang Long and Chuang Gan and Gerard de Melo},
journal= {arXiv preprint arXiv:1612.00234},
year = {2016}
}