中文

用于视频描述的循环记忆寻址

计算机视觉与模式识别 2017-03-24 v2 计算与语言

摘要

在本文中,我们将 Key-Value Memory Networks 引入多模态设置,并提出了一种新的键寻址机制来处理序列到序列模型。所提出的模型自然地将视频描述问题分解为视觉和语言片段,并将它们作为键值对进行处理。更具体地说,我们学习视频中每一帧 (k) 对应的语义嵌入 (v),从而创建 (k, v) 记忆槽。我们提出在记忆寻址模式中,基于先前注意力分布为键值记忆槽寻找下一步的注意力权重。利用该框架的这种灵活性,我们在从视觉嵌入映射到语义嵌入的同时额外捕获了空间依赖性。在 Youtube2Text 数据集上进行的实验证明了循环键寻址的有效性,同时在 BLEU@4 和 METEOR 指标上取得了与 SOTA 模型相当的分数。

关键词

引用

@article{arxiv.1611.06492,
  title  = {Recurrent Memory Addressing for describing videos},
  author = {Arnav Kumar Jain and Abhinav Agarwalla and Kumar Krishna Agrawal and Pabitra Mitra},
  journal= {arXiv preprint arXiv:1611.06492},
  year   = {2017}
}