Efficient-VQGAN:基于高效视觉Transformer的高分辨率图像生成
计算机视觉与模式识别
2023-10-10 v1
摘要
向量量化图像建模在合成高质量图像方面已展现出巨大潜力。然而,由于自注意力过程的二次计算开销,生成高分辨率图像仍是一项具有挑战性的任务。在本研究中,我们致力于探索一种更高效的两阶段高分辨率图像生成框架,在以下三个方面进行改进。(1)基于第一量化阶段具有稳固局部特性的观察,我们采用基于局部注意力的量化模型,取代先前方法中使用的全局注意力机制,从而获得更好的效率与重建质量。(2)我们强调图像生成过程中多粒度特征交互的重要性,并引入一种结合全局注意力(整幅图像内的长程语义一致性)与局部注意力(细粒度细节)的高效注意力机制。该方法带来了更快的生成速度、更高的生成保真度以及改善的分辨率。(3)我们提出了一种融合自编码训练与自回归生成策略的新生成流程,展示了一种更优的图像合成范式。大量实验证明了我们的方法在高质量和高分辨率图像重建与生成方面的优越性。
引用
@article{arxiv.2310.05400,
title = {Efficient-VQGAN: Towards High-Resolution Image Generation with Efficient Vision Transformers},
author = {Shiyue Cao and Yueqin Yin and Lianghua Huang and Yu Liu and Xin Zhao and Deli Zhao and Kaiqi Huang},
journal= {arXiv preprint arXiv:2310.05400},
year = {2023}
}
备注
This paper is accepted to ICCV2023