复活掩码自回归建模:高效可扩展的图像生成
计算机视觉与模式识别
2025-07-18 v1
摘要
自回归(AR)模型在图像生成方面取得了显著进展,掩码自回归(MAR)模型因其高效的并行解码而受到关注。然而,传统下来的 MAR 模型在与标准 AR 模型的比较时表现不佳。本研究改进 MAR 架构以提升图像生成质量。我们首先评估了各种图像标记化器,以确定最有效的一种。随后,我们引入改进的双向 LLaMA 架构,通过用双向注意力取代因果注意力并纳入 2D RoPE,形成我们先进的模型,即 MaskGIL。MaskGIL 规模从 1.11 亿参数扩展至 14 亿参数,在 ImageNet 256x256 基准测试中实现了 3.71 的 FID 分数,与最先进的 AR 模型持平,同时仅需 8 步推理,而 AR 模型需要 256 步。此外,我们开发了具有 7.75 亿参数的文本驱动 MaskGIL 模型,用于在各种分辨率下从文本生成图像。除了图像生成,MaskGIL 还可加速基于 AR 的生成并实现实时语音到图像转换。我们的代码和模型已在 https://github.com/synbol/MaskGIL 上提供。
引用
@article{arxiv.2507.13032,
title = {Resurrect Mask AutoRegressive Modeling for Efficient and Scalable Image Generation},
author = {Yi Xin and Le Zhuo and Qi Qin and Siqi Luo and Yuewen Cao and Bin Fu and Yangfan He and Hongsheng Li and Guangtao Zhai and Xiaohong Liu and Peng Gao},
journal= {arXiv preprint arXiv:2507.13032},
year = {2025}
}
备注
24 pages, 10 figures, 10 tables