Image Transformer
计算机视觉与模式识别
2018-06-19 v3
摘要
图像生成已成功被表述为自回归序列生成或变换问题。近期工作表明,自注意力是建模文本序列的有效方式。在本工作中,我们将一种近期提出的基于自注意力的模型架构——Transformer,推广到具有可处理似然的图像生成的序列建模形式。通过将自注意力机制限制为关注局部邻域,我们显著增大了模型实际可处理的图像尺寸,同时保持了比典型卷积神经网络每层的感受野大得多的感受野。尽管概念简单,我们的生成模型在ImageNet上的图像生成任务中显著优于当前最优方法,将ImageNet上已发表的最佳负对数似然从3.83提升至3.77。我们还以编码器-解码器配置展示了大倍率图像超分辨率结果。在一项人类评估研究中,我们发现由我们的超分辨率模型生成的图像欺骗人类观察者的频率是此前最优方法的三倍。
引用
@article{arxiv.1802.05751,
title = {Image Transformer},
author = {Niki Parmar and Ashish Vaswani and Jakob Uszkoreit and Łukasz Kaiser and Noam Shazeer and Alexander Ku and Dustin Tran},
journal= {arXiv preprint arXiv:1802.05751},
year = {2018}
}
备注
Appears in International Conference on Machine Learning, 2018. Code available at https://github.com/tensorflow/tensor2tensor