中文

通过奖励建模提升图像生成中的空间理解

计算机视觉与模式识别 2026-03-02 v1

摘要

最近的文本到图像生成进展大大提升了视觉保真度和创造力,但也对提示的复杂性提出了更高要求,尤其是在编码复杂空间关系时。若要实现满意的结果,往往需要多次采样尝试。为此,我们提出一种新方法,强化当前图像生成模型的空间理解能力。我们首先构建了包含 80k 条偏好对的 SpatialReward-Dataset。基于此数据集,我们构建 SpatialScore,一种用于评估文本到图像生成中空间关系准确性的奖励模型,性能甚至超越了领先的专有模型。我们进一步演示了这一奖励模型有效地启用了复杂空间生成的在线强化学习。跨多个基准的大量实验表明,我们的专用奖励模型为图像生成的空间理解带来了显著且持续的提升。

关键词

引用

@article{arxiv.2602.24233,
  title  = {Enhancing Spatial Understanding in Image Generation via Reward Modeling},
  author = {Zhenyu Tang and Chaoran Feng and Yufan Deng and Jie Wu and Xiaojie Li and Rui Wang and Yunpeng Chen and Daquan Zhou},
  journal= {arXiv preprint arXiv:2602.24233},
  year   = {2026}
}

备注

Accepted at CVPR 2026. Github: https://github.com/DAGroup-PKU/SpatialT2I Project website: https://dagroup-pku.github.io/SpatialT2I/