中文

用于视频字幕的时空动态与语义属性增强视觉编码

计算机视觉与模式识别 2019-04-30 v2

摘要

视频字幕的自动生成是计算机视觉中的基本挑战。近期技术通常采用卷积神经网络(CNNs)与递归神经网络(RNNs)的组合进行视频字幕。这些方法主要通过 RNNs 定制序列学习以生成更好字幕,而现成视觉特征借自 CNNs。我们认为为此任务精心设计的视觉特征同等重要,并提出了一种视觉特征编码技术,使用门控循环单元(GRUs)生成语义丰富的字幕。我们的方法通过对整段视频的 CNN 特征分层应用短时傅里叶变换,将丰富的时间动态嵌入视觉特征。它还从目标检测器导出高层语义,以所检测目标的空间动态丰富表示。最终表示被投影到紧凑空间并送入语言模型。通过学习由两层 GRU 组成的相对简单的语言模型,我们在 MSVD 与 MSR-VTT 数据集上针对 METEOR 与 ROUGE_L 指标确立了新的 SOTA。

关键词

引用

@article{arxiv.1902.10322,
  title  = {Spatio-Temporal Dynamics and Semantic Attribute Enriched Visual Encoding for Video Captioning},
  author = {Nayyer Aafaq and Naveed Akhtar and Wei Liu and Syed Zulqarnain Gilani and Ajmal Mian},
  journal= {arXiv preprint arXiv:1902.10322},
  year   = {2019}
}

备注

Accepted in CVPR-2019 (Camera Ready)