用于视频描述的时序可变形卷积编解码网络
计算机视觉与模式识别
2019-05-06 v1
摘要
人们普遍认为,视频描述是计算机视觉和人工智能领域中一项基础且具有挑战性的任务。主流方法是经由循环神经网络(RNN),以序列到序列的方式将输入视频映射为可变长度的输出句子。然而,RNN 的训练仍在一定程度上受到梯度消失/爆炸问题的困扰,使得优化变得困难。此外,RNN 内在的循环依赖阻碍了训练期间序列内的并行化,从而限制了计算。在本文中,我们提出了一种新颖的设计——时序可变形卷积编解码网络(简称为 TDConvED),在编码器和解码器网络中均完全采用卷积来进行视频描述。在技术上,我们利用卷积块结构来计算固定数量输入的中间状态,并堆叠多个块以捕捉长期关系。编码器中的结构进一步配备了时序可变形卷积,以实现时序采样的自由形变。我们的模型还利用时序注意力机制来生成句子。在 MSVD 和 MSR-VTT 视频描述数据集上进行了大量实验,与传统的基于 RNN 的编解码技术相比,报告了更优的结果。更引人注目的是,TDConvED 在 MSVD 上将 CIDEr-D 性能从 58.8% 提升至 67.2%。
引用
@article{arxiv.1905.01077,
title = {Temporal Deformable Convolutional Encoder-Decoder Networks for Video Captioning},
author = {Jingwen Chen and Yingwei Pan and Yehao Li and Ting Yao and Hongyang Chao and Tao Mei},
journal= {arXiv preprint arXiv:1905.01077},
year = {2019}
}
备注
AAAI 2019