中文

基于非自回归由粗到细解码的视频描述生成

计算机视觉与模式识别 2021-03-25 v6

摘要

令人鼓舞的是,在连接视频与自然语言方面已取得进展。然而,主流视频描述生成方法由于自回归解码的顺序性而推理速度慢,且因视觉词(如名词与动词)训练不足及解码范式不当而倾向于生成泛化描述。本文提出一种基于非自回归解码并采用由粗到细描述生成流程的模型以缓解这些缺陷。实现上,我们采用基于双向自注意力的网络作为语言模型以实现推理加速,并据此将描述生成分为两个阶段,模型在各阶段关注点不同。具体而言,鉴于视觉词决定描述语义正确性,我们设计生成视觉词的机制,不仅促进场景相关词训练,还从视频捕捉相关细节以构建粗粒度句子“模板”。随后,我们设计专用解码算法,以合适词填充“模板”并通过迭代精修修改不当措辞,得到细粒度描述。在 MSVD 与 MSR-VTT 两个主流视频描述基准上的大量实验表明,本方法取得 SOTA 性能,生成多样化描述且推理高效。代码见 https://github.com/yangbang18/Non-Autoregressive-Video-Captioning。

关键词

引用

@article{arxiv.1911.12018,
  title  = {Non-Autoregressive Coarse-to-Fine Video Captioning},
  author = {Bang Yang and Yuexian Zou and Fenglin Liu and Can Zhang},
  journal= {arXiv preprint arXiv:1911.12018},
  year   = {2021}
}

备注

9 pages, 6 figures, to be published in AAAI2021. Our code is available at https://github.com/yangbang18/Non-Autoregressive-Video-Captioning