从确定性到生成性:用于视频字幕生成的多模态随机 RNN
计算机视觉与模式识别
2017-10-23 v2
摘要
视频字幕生成本质上是一个复杂的自然过程,受到来自视频内容、主观判断等各种不确定性的影响。在本文中,我们基于近期在 encoder-decoder 框架用于视频字幕生成方面的进展,解决了我们发现现有方法存在的一个关键缺陷,即大多数解码器传播的是确定性隐状态。这种复杂的不确定性无法由确定性模型有效建模。在本文中,我们提出了一种生成式方法,称为多模态随机 RNN 网络(MS-RNN),该方法使用潜在随机变量对数据中观察到的不确定性进行建模。因此,MS-RNN 能够提高视频字幕生成的性能,并考虑不同的随机因素生成多个句子来描述一个视频。具体而言,首先提出了一个多模态 LSTM(M-LSTM),以与视觉和文本特征进行交互,从而捕获高阶表示。然后,提出了一个后向随机 LSTM(S-LSTM),通过引入潜在变量来支持不确定性传播。在具有挑战性的数据集 MSVD 和 MSR-VTT 上的实验结果表明,我们提出的 MS-RNN 方法优于 state-of-the-art 的视频字幕生成基准。
引用
@article{arxiv.1708.02478,
title = {From Deterministic to Generative: Multi-Modal Stochastic RNNs for Video Captioning},
author = {Jingkuan Song and Yuyu Guo and Lianli Gao and Xuelong Li and Alan Hanjalic and Heng Tao Shen},
journal= {arXiv preprint arXiv:1708.02478},
year = {2017}
}