中文

T2I-R1:通过协同语义级与令牌级思维链强化图像生成

计算机视觉与模式识别 2025-07-02 v2 人工智能 计算与语言 机器学习

摘要

近期大型语言模型的进展展示了思维链(CoT)和强化学习(RL)如何提升性能。然而,将此类推理策略应用于视觉生成领域在很大程度上仍未被探索。在本文中,我们提出了T2I-R1,这是一种新颖的推理增强型文本到图像生成模型,由具有双层CoT推理过程的RL驱动。具体来说,我们确定了两个可用于增强生成不同阶段的CoT层级:(1)用于提示高层规划的语义级CoT,以及(2)用于逐块生成过程中低层像素处理的令牌级CoT。为了更好地协调这两个层级的CoT,我们引入了带有集成生成奖励的BiCoT-GRPO,它能在同一步训练中无缝优化两种生成CoT。通过将我们的推理策略应用于基线模型Janus-Pro,我们在T2I-CompBench上取得了13%的提升,在WISE基准上取得了19%的提升,甚至超越了最先进的模型FLUX.1。代码可在以下地址获取:https://github.com/CaraJ7/T2I-R1

关键词

引用

@article{arxiv.2505.00703,
  title  = {T2I-R1: Reinforcing Image Generation with Collaborative Semantic-level and Token-level CoT},
  author = {Dongzhi Jiang and Ziyu Guo and Renrui Zhang and Zhuofan Zong and Hao Li and Le Zhuo and Shilin Yan and Pheng-Ann Heng and Hongsheng Li},
  journal= {arXiv preprint arXiv:2505.00703},
  year   = {2025}
}

备注

Project Page: https://github.com/CaraJ7/T2I-R1