端到端视频描述生成
计算机视觉与模式识别
2019-11-11 v2 人工智能
摘要
在视频描述生成等许多视觉识别应用中,建立视频与语言等不同模态之间的对应关系近来变得至关重要。受机器翻译启发,近期模型采用编码器-解码器策略处理该任务。传统上(视频)编码器为卷积神经网络(CNN),而解码(用于语言生成)由循环神经网络(RNN)完成。然而,当前最先进的方法分别训练编码器和解码器。CNN 在物体和/或动作识别任务上预训练,并用于编码视频级特征。随后在该静态特征上优化解码器以生成视频描述。这种分离式设置对于从输入(视频)到输出(描述)的映射而言并非最优。本工作中,我们提出以端到端方式同时优化编码器与解码器。在两阶段训练设定中,我们首先使用预训练的编码器和解码器初始化架构,随后在微调阶段对整个网络进行端到端训练,以学习对视频描述生成最相关的特征。实验中,我们使用 GoogLeNet 和 Inception-ResNet-v2 作为编码器,并使用原创的软注意力(SA-)LSTM 作为解码器。与其他计算机视觉问题中观察到的增益类似,我们表明端到端训练相比传统的分离式训练过程有显著提升。我们在微软研究院视频描述(MSVD)和 MSR 视频转文本(MSR-VTT)基准数据集上评估了我们的端到端(EtENet)网络,展示了 EtENet 如何在各项指标上达到最先进的性能。
引用
@article{arxiv.1904.02628,
title = {End-to-End Video Captioning},
author = {Silvio Olivastri and Gurkirt Singh and Fabio Cuzzolin},
journal= {arXiv preprint arXiv:1904.02628},
year = {2019}
}
备注
Accepted at Large Scale Holistic Video Understanding, ICCVW 2019