中文

X-Omni:强化学习重塑离散自回归图像生成模型

计算机视觉与模式识别 2025-07-30 v1

摘要

已有大量努力尝试将“下一个 token 预测”范式扩展到视觉内容,以创建一种统一的图像生成与理解方法。然而,尝试通过离散 token 的自回归建模生成图像的尝试一直面临低视觉保真度、输出失真以及在渲染复杂细节时无法遵循复杂指令等问题。这些不足可能归因于自回归推理期间的累积误差或离散化过程中信息的损失。鉴于此挑战,近期研究越来越倾向于联合训练图像生成与扩散目标以及语言生成与自回归目标,摆脱统一建模方法。本文展示了强化学习能够有效缓解图像生成中离散自回归建模方法中的 artifact,大大提升生成质量,从而实现图像与语言生成的无缝集成。我们的框架包括语义图像 tokenizer、用于语言和图像的统一自回归模型,以及用于图像生成的离线扩散解码器,称为 X-Omni。X-Omni 在使用 7B 语言模型进行图像生成任务中实现了最先进的性能,生成的图像在审美质量方面表现优异,同时在跟随指令和渲染长文本方面表现出强大的能力。

关键词

引用

@article{arxiv.2507.22058,
  title  = {X-Omni: Reinforcement Learning Makes Discrete Autoregressive Image Generative Models Great Again},
  author = {Zigang Geng and Yibing Wang and Yeyao Ma and Chen Li and Yongming Rao and Shuyang Gu and Zhao Zhong and Qinglin Lu and Han Hu and Xiaosong Zhang and Linus and Di Wang and Jie Jiang},
  journal= {arXiv preprint arXiv:2507.22058},
  year   = {2025}
}