中文

基于掩码 Transformer 的端到端密集视频描述

计算机视觉与模式识别 2018-04-04 v1

摘要

密集视频描述旨在为未修剪视频中的所有事件生成文本描述。这涉及检测和描述事件两个方面。因此,所有先前的密集视频描述方法都通过构建两个模型来解决此问题,即用于这两个子问题的事件提议模型和描述模型。这些模型要么分开训练,要么交替训练。这阻止了语言描述对事件提议的直接影响,而后者对于生成准确描述十分重要。为了解决这个问题,我们提出了一种用于密集视频描述的端到端 Transformer 模型。编码器将视频编码为适当的表示。提议解码器从不同锚点解码编码以形成视频事件提议。描述解码器采用掩码网络将其注意力限制于编码特征上的提议事件。该掩码网络将事件提议转换为可微掩码,从而确保训练期间提议与描述的一致性。此外,我们的模型采用自注意力机制,使得在编码期间能够使用高效的非循环结构并带来性能提升。我们在 ActivityNet Captions 和 YouCookII 数据集上证明了该端到端模型的有效性,分别取得了 10.12 和 6.58 的 METEOR 分数。

关键词

引用

@article{arxiv.1804.00819,
  title  = {End-to-End Dense Video Captioning with Masked Transformer},
  author = {Luowei Zhou and Yingbo Zhou and Jason J. Corso and Richard Socher and Caiming Xiong},
  journal= {arXiv preprint arXiv:1804.00819},
  year   = {2018}
}

备注

To appear at CVPR18