用于将视频翻译为文本的自适应特征抽象
计算机视觉与模式识别
2017-11-20 v3 计算与语言
摘要
以往的视频描述模型通常使用卷积神经网络 (CNN) 特定层的输出作为视频特征。然而,视频中依赖于上下文的可变语义可能使得从多个 CNN 层中自适应地选择特征更为合适。我们提出了一种新方法,为描述任务生成视频的自适应时空表示。我们开发了一种新颖的注意力机制,该机制自适应且顺序地关注 CNN 特征的不同层(特征“抽象”的级别),以及每层特征图上的局部时空区域。所提出的方法在三个基准数据集上进行了评估:YouTube2Text、M-VAD 和 MSR-VTT。除了对结果及模型工作原理进行可视化外,这些实验定量地证明了所提出的自适应时空特征抽象在将视频翻译为具有丰富语义的句子方面的有效性。
引用
@article{arxiv.1611.07837,
title = {Adaptive Feature Abstraction for Translating Video to Text},
author = {Yunchen Pu and Martin Renqiang Min and Zhe Gan and Lawrence Carin},
journal= {arXiv preprint arXiv:1611.07837},
year = {2017}
}
备注
Accepted to AAAI 2018