ConvTransformer:一种用于视频帧合成的可卷积 Transformer 网络
计算机视觉与模式识别
2021-06-03 v2
摘要
深度卷积神经网络(CNNs)是强大的模型,在困难的计算机视觉任务上取得了优异性能。尽管在有大量标注训练样本时 CNNs 表现良好,但由于视频序列中物体形变与运动、场景光照变化以及相机运动,它们在视频帧合成上表现糟糕。本文提出一种新颖且通用的端到端架构,称为卷积 Transformer 或 ConvTransformer,用于视频帧序列学习与视频帧合成。ConvTransformer 的核心成分是所提出的注意力层,即多头卷积自注意力层,其学习视频序列的时序依赖性。ConvTransformer 使用基于多头卷积自注意力层构建的编码器来编码输入帧之间的时序依赖性,然后由解码器解码目标合成帧与输入帧之间的长期依赖性。在视频未来帧外推任务上的实验表明,ConvTransformer 在质量上更优,同时比基于卷积 LSTM (ConvLSTM) 的近期方法更具可并行性。据我们所知,这是首次提出并将 ConvTransformer 架构应用于视频帧合成。
引用
@article{arxiv.2011.10185,
title = {ConvTransformer: A Convolutional Transformer Network for Video Frame Synthesis},
author = {Zhouyong Liu and Shun Luo and Wubin Li and Jingben Lu and Yufan Wu and Shilei Sun and Chunguo Li and Luxi Yang},
journal= {arXiv preprint arXiv:2011.10185},
year = {2021}
}