Token-Shuffle:面向高分辨率图像生成的自回归模型方法
计算机视觉与模式识别
2025-04-29 v2
摘要
自回归(AR)模型长期主导语言生成领域,日益被应用于图像合成,但常被视为不如扩散模型具有竞争力。其主要限制是AR模型所需的图像标记数量较大,这限制了训练和推理效率,以及图像分辨率。为此,我们提出Token-Shuffle,这是一种新颖而简单的方法,可降低Transformer中图像标记的数量。我们的关键洞察是,来自视觉编码器的低维视觉代码直接映射到高维语言词汇表时,存在维度冗余。利用这一点,我们考虑两种关键操作:token-shuffle将在通道维度上合并空间局部标记以减少输入标记数量,以及token-unshuffle在Transformer块之后解缠推断标记以恢复空间布局以用于输出。通过与文本提示联合训练,我们的策略无需额外的预训练文本编码器,即可使MLLM支持以统一的下一个标记预测方式进行极高分辨率图像合成,同时保持高效的训练和推理。首次,我们将AR文本到图像生成的边界推进至2048x2048分辨率,实现令人满意的生成性能。在GenAI-benchmark中,我们的27亿参数模型在硬性提示上的整体得分为0.77,超越AR模型LlamaGen 0.18,超过扩散模型LDM 0.15。大量大规模人类评估也表明,我们在文本对齐、视觉缺陷和视觉外观方面都具有突出的图像生成能力。我们希望Token-Shuffle可以作为MLLM中高效高分辨率图像生成的基础设计。
引用
@article{arxiv.2504.17789,
title = {Token-Shuffle: Towards High-Resolution Image Generation with Autoregressive Models},
author = {Xu Ma and Peize Sun and Haoyu Ma and Hao Tang and Chih-Yao Ma and Jialiang Wang and Kunpeng Li and Xiaoliang Dai and Yujun Shi and Xuan Ju and Yushi Hu and Artsiom Sanakoyeu and Felix Juefei-Xu and Ji Hou and Junjiao Tian and Tao Xu and Tingbo Hou and Yen-Cheng Liu and Zecheng He and Zijian He and Matt Feiszli and Peizhao Zhang and Peter Vajda and Sam Tsai and Yun Fu},
journal= {arXiv preprint arXiv:2504.17789},
year = {2025}
}
备注
Project Page: https://ma-xu.github.io/token-shuffle/ Add related works