中文

基于迁移语义属性的视频描述

计算机视觉与模式识别 2016-11-24 v1

摘要

自动生成视频的自然语言描述是计算机视觉领域的一项根本性挑战。该问题的最新进展大多通过使用 2-D 和/或 3-D 卷积神经网络(CNN)编码视频内容,并使用循环神经网络(RNN)解码句子来实现。本文提出了一种新颖的深度架构——带有迁移语义属性的长短期记忆网络(LSTM-TSA),该架构通过端到端训练,将从图像和视频中学习到的迁移语义属性融入 CNN 加 RNN 框架。LSTM-TSA 的设计深受以下事实启发:1)语义属性对描述生成有显著贡献;2)图像和视频携带互补语义,因此可以相互增强以进行描述。为提升视频描述效果,我们提出了一种新颖的迁移单元,用于建模从图像和视频中学习到的相互关联的属性。在三个公开数据集(MSVD、M-VAD 和 MPII-MD)上进行了广泛实验。我们提出的 LSTM-TSA 在 MSVD 上的句子生成性能达到了迄今已发表的最佳结果:BLEU@4 为 52.8%,CIDEr-D 为 74.0%。在 M-VAD 和 MPII-MD 上,与最先进方法相比也取得了更优的结果。

关键词

引用

@article{arxiv.1611.07675,
  title  = {Video Captioning with Transferred Semantic Attributes},
  author = {Yingwei Pan and Ting Yao and Houqiang Li and Tao Mei},
  journal= {arXiv preprint arXiv:1611.07675},
  year   = {2016}
}