Infinity:扩展位运算自回归建模用于高分辨率图像合成
计算机视觉与模式识别
2025-06-18 v2
摘要
我们提出了 Infinity,一种能够在语言指令下生成高分辨率逼真图像的位运算视觉自回归建模方法。Infinity 在位令牌预测框架下重新定义视觉自回归模型,采用无限词汇 tokenizer 与 classifier,以及位自校正机制,显著提升了生成容量和细节。通过理论上将 tokenizer 词汇大小扩展至无限,同时扩展 transformer 规模,我们的方法显著释放了相较于普通 VAR 的强大扩展能力。Infinity 创下了自回归文本到图像模型的新纪录,超越了像 SD3-Medium 和 SDXL 等顶级扩散模型。值得注意的是,Infinity 将 GenEval 基准测试分数从 0.62 提升到 0.73,将 ImageReward 基准测试分数从 0.87 提升到 0.96,实现 66% 的胜率。无需额外优化,Infinity 在 0.8 秒内生成一张高质量的 1024x1024 图像,速度是 SD3-Medium 的 2.6 倍,成为最快的文本到图像模型。模型和代码将发布,以推动 Infinity 在视觉生成和统一 tokenizer 建模方面的进一步探索。
引用
@article{arxiv.2412.04431,
title = {Infinity: Scaling Bitwise AutoRegressive Modeling for High-Resolution Image Synthesis},
author = {Jian Han and Jinlai Liu and Yi Jiang and Bin Yan and Yuqi Zhang and Zehuan Yuan and Bingyue Peng and Xiaobing Liu},
journal= {arXiv preprint arXiv:2412.04431},
year = {2025}
}
备注
17 pages, 14 figures