中文

联合建模嵌入与翻译以桥接视频与语言

计算机视觉与模式识别 2015-06-05 v3 多媒体

摘要

用自然语言自动描述视频内容是多媒体领域的一项基本挑战。循环神经网络(RNN)对序列动态建模,在视觉解释中受到越来越多的关注。然而,大多数现有方法在给定先前单词和视觉内容的情况下局部生成单词,而句子语义与视觉内容之间的关系未被整体利用。因此,生成的句子在上下文上可能正确,但语义(例如主语、动词或宾语)不真实。本文提出一种名为具有视觉语义嵌入的长短期记忆(LSTM-E)的新型统一框架,可同时探索 LSTM 的学习与视觉语义嵌入。前者旨在局部最大化给定先前单词和视觉内容时生成下一个单词的概率,而后者用于创建视觉语义嵌入空间,以强化整个句子语义与视觉内容之间的关系。我们提出的 LSTM-E 包含三个组件:用于学习强大视频表示的 2-D 和/或 3-D 深度卷积神经网络、用于生成句子的深度 RNN,以及用于探索视觉内容与句子语义之间关系的联合嵌入模型。在 YouTube2Text 数据集上的实验表明,我们提出的 LSTM-E 在生成自然句子方面达到了迄今为止报告的最佳性能:就 BLEU@4 和 METEOR 而言分别为 45.3% 和 31.0%。我们还证明 LSTM-E 在预测主谓宾(SVO)三元组方面优于几种最先进的技术。

关键词

引用

@article{arxiv.1505.01861,
  title  = {Jointly Modeling Embedding and Translation to Bridge Video and Language},
  author = {Yingwei Pan and Tao Mei and Ting Yao and Houqiang Li and Yong Rui},
  journal= {arXiv preprint arXiv:1505.01861},
  year   = {2015}
}