中文

重审非自回归 Transformer 在高效图像合成中的应用

计算机视觉与模式识别 2024-06-11 v1 人工智能

摘要

图像合成领域因扩散模型的突破性进展而蓬勃发展。尽管扩散模型取得了成功,但其计算密集性促使人们寻求更高效的替代方案。作为代表性工作,非自回归 Transformer (NAT) 因其快速生成能力受到关注。然而,这些模型与扩散模型相比性能有显著劣势。本文旨在重新评估 NAT 的全部潜力,通过重新审视其训练和推理策略的设计。具体而言,我们识别到正确配置这些策略存在的复杂性,并指出现有基于经验的方法可能存在次优。鉴于此,我们提出超越现有方法的思路,通过自动化框架直接求解最优策略。得到的新方法名为 AutoNAT,显著提升了 NAT 的性能边界,能够以显著降低的推理成本与最新扩散模型持相当水平。我们将在四个基准数据集上验证 AutoNAT 的有效性,即 ImageNet-256 与 512、MS-COCO 和 CC3M。我们的代码已公开于 https://github.com/LeapLabTHU/ImprovedNAT。

关键词

引用

@article{arxiv.2406.05478,
  title  = {Revisiting Non-Autoregressive Transformers for Efficient Image Synthesis},
  author = {Zanlin Ni and Yulin Wang and Renping Zhou and Jiayi Guo and Jinyi Hu and Zhiyuan Liu and Shiji Song and Yuan Yao and Gao Huang},
  journal= {arXiv preprint arXiv:2406.05478},
  year   = {2024}
}

备注

Accepted by CVPR2024