中文

用于视频描述的重建网络

计算机视觉与模式识别 2018-04-02 v1

摘要

本文解决了用自然语言描述视频序列视觉内容的问题。不同于以往主要利用视频内容线索来生成语言描述的视频描述工作,我们提出了一种具有新颖编码器-解码器-重建器架构的重建网络(RecNet),该网络同时利用前向(视频到句子)和后向(句子到视频)流进行视频描述。具体而言,编码器-解码器利用前向流,基于编码的视频语义特征生成句子描述。我们定制了两种类型的重建器,以利用后向流并基于解码器生成的隐藏状态序列重现视频特征。由编码器-解码器产生的生成损失与由重建器引入的重建损失被联合用于以端到端方式训练所提出的 RecNet。在基准数据集上的实验结果表明,所提出的重建器能够提升编码器-解码器模型,并显著提高视频描述的准确率。

关键词

引用

@article{arxiv.1803.11438,
  title  = {Reconstruction Network for Video Captioning},
  author = {Bairui Wang and Lin Ma and Wei Zhang and Wei Liu},
  journal= {arXiv preprint arXiv:1803.11438},
  year   = {2018}
}

备注

Accepted by CVPR 2018