中文

用于视频字幕的记忆注意力循环网络

计算机视觉与模式识别 2019-05-13 v1

摘要

典型的视频字幕技术遵循编码器-解码器框架,其只能关注正在被处理的一个源视频。此种设计的潜在缺点是,它无法捕获在训练数据中出现在多个相关视频中的某个词的多种视觉上下文信息。为应对此局限,我们提出用于视频字幕的记忆注意力循环网络(MARN),其中设计了一种记忆结构来探索一个词与其在训练数据中跨视频的各种相似视觉上下文之间的全谱对应。因此,我们的模型能够对每个词实现更全面的理解并产生更高质量的字幕。此外,所构建的记忆结构使我们的方法能够显式地建模相邻词之间的兼容性,而非像大多数现有模型那样要求模型隐式学习。在两个真实数据集上的大量验证表明,我们的MARN一致地优于最先进的方法。

关键词

引用

@article{arxiv.1905.03966,
  title  = {Memory-Attended Recurrent Network for Video Captioning},
  author = {Wenjie Pei and Jiyuan Zhang and Xiangrong Wang and Lei Ke and Xiaoyong Shen and Yu-Wing Tai},
  journal= {arXiv preprint arXiv:1905.03966},
  year   = {2019}
}

备注

Accepted by CVPR 2019