中文

RL-RIG:基于内在反思的生成式空间推理器

计算机视觉与模式识别 2026-05-11 v2

摘要

近期的图像生成技术取得了显著进展, 在生成高质量图像方面取得了令人瞩目的成果。然而,现有的图像生成模型仍普遍面临空间推理困境,缺乏准确捕捉提示中细粒度空间关系的能力, 以及正确生成结构完整场景的能力。为缓解这一困境,我们提出了 RL-RIG, 即基于反射的图像生成的强化学习框架。我们的架构包含四个主要组件:Diffuser、Checker、Actor 和 Inverse Diffuser, 遵循 Generate-Reflect-Edit 范式,以激发图像生成中的链式思考推理能力, 从而应对这一困境。为使模型对生成轨迹拥有更好的直觉, 我们进一步开发了 Reflection-GRPO 来训练 VLM Actor 以处理编辑提示, 以及 Image Editor 以在给定提示下获得更好的图像质量。与传统方法仅生成视觉上令人惊叹但结构上不合理内容不同, 我们评估指标侧重空间准确性, 采用 Scene Graph IoU 并采用 VLM 作为裁判器策略, 评估在 LAION-SG 数据集上生成图像的空间一致性。实验结果表明, RL-RIG 在可控且精确的空间推理方面优于现有最先进的开源模型, 最多提升 11%。

关键词

引用

@article{arxiv.2602.19974,
  title  = {RL-RIG: A Generative Spatial Reasoner via Intrinsic Reflection},
  author = {Tianyu Wang and Zhiyuan Ma and Qian Wang and Xinyi Zhang and Xinwei Long and Bowen Zhou},
  journal= {arXiv preprint arXiv:2602.19974},
  year   = {2026}
}