中文

基于强化学习重构与表征视频内容以生成描述

计算机视觉与模式识别 2019-06-05 v1

摘要

本文研究了用自然语言描述视频序列视觉内容的问题。与以往主要利用视频内容线索进行语言描述生成的视频描述工作不同,我们提出了一种新颖的编码器-解码器-重构器架构中的重构网络(RecNet),该网络利用前向(视频到句子)和后向(句子到视频)双向流进行视频描述。具体而言,编码器-解码器组件利用前向流,基于编码后的视频语义特征生成句子描述。随后提出两类重构器,利用解码器生成的隐藏状态序列,分别从局部和全局视角采用后向流重现视频特征。此外,为对视频特征进行全面的重构,我们提出将两类重构器融合在一起。编码器-解码器组件产生的生成损失与重构器引入的重构损失被共同纳入所提 RecNet 的端到端训练。进一步地,RecNet 通过 CIDEr 优化经强化学习微调,显著提升了描述性能。在基准数据集上的实验结果表明,所提重构器能持续提升视频描述性能。

关键词

引用

@article{arxiv.1906.01452,
  title  = {Reconstruct and Represent Video Contents for Captioning via Reinforcement Learning},
  author = {Wei Zhang and Bairui Wang and Lin Ma and Wei Liu},
  journal= {arXiv preprint arXiv:1906.01452},
  year   = {2019}
}

备注

Accepted by TPAMI. arXiv admin note: substantial text overlap with arXiv:1803.11438