中文

基于双向循环神经网络的视频描述

计算机视觉与模式识别 2016-12-13 v2 计算与语言 机器学习

摘要

尽管编码器-解码器框架传统上用于机器翻译领域,但最近已被应用于视频和图像描述生成。这些模型中卷积神经网络与循环神经网络的结合已被证明优于先前的最先进方法,获得了更精确的视频描述。在这项工作中,我们提议通过向编码阶段引入两点贡献来进一步推进该模型。首先,通过结合来自卷积神经网络的对象与位置信息来产生更丰富的图像表示;其次,引入双向循环神经网络以捕获输入帧中的前向与后向时间关系。

关键词

引用

@article{arxiv.1604.03390,
  title  = {Video Description using Bidirectional Recurrent Neural Networks},
  author = {Álvaro Peris and Marc Bolaños and Petia Radeva and Francisco Casacuberta},
  journal= {arXiv preprint arXiv:1604.03390},
  year   = {2016}
}

备注

8 pages, 3 figures, 1 table, Submitted to International Conference on Artificial Neural Networks (ICANN)