中文

从“是什么”到“如何”: 自回归图像生成中的受限推理

计算机视觉与模式识别 2026-03-04 v1 多媒体 图像与视频处理

摘要

自回归图像生成近期通过引入链式思维和强化学习取得了显著进展。然而,现有方法仅通过改写输入提示来指定“是什么”细节,却从根本上未能就图像的整体结构进行“如何”推理。这种内在限制导致了诸多问题,例如空间歧义直接引发不真实的物体重叠。为弥合这一差距,我们提出了CoR-Painter框架,首次提出“如何-是什么”范式,通过引入受限推理来指导自回归图像生成。具体而言,该方法首先通过从输入提示中推导一组视觉约束来确定“如何绘制”,这些约束明确地控制空间关系、关键属性和组成规则。这些约束引导后续“是什么绘制”详细描述的生成,为准确的视觉合成提供结构严谨且连贯的基础。此外,我们引入双目标GRPO策略,专门优化文本受限推理和视觉投影过程,以确保整个生成管道的连贯性与质量。大量实验在T2I-CompBench、GenEval和WISE上均表现出色,实现了最新技术水平,尤其在空间指标上提升显著(例如在T2I-CompBench上提升5.41%)。

关键词

引用

@article{arxiv.2603.02712,
  title  = {From "What" to "How": Constrained Reasoning for Autoregressive Image Generation},
  author = {Ruxue Yan and Xubo Liu and Wenya Guo and Zhengkun Zhang and Ying Zhang and Xiaojie Yuan},
  journal= {arXiv preprint arXiv:2603.02712},
  year   = {2026}
}