合成课程强化文本到图像的组成性生成
计算机视觉与模式识别
2025-11-25 v1
摘要
文本到图像 (Text-to-Image, T2I) 生成长期以来都是开放问题,其中组合性合成尤其具有挑战性.该任务要求精准地渲染包含多个具有多样属性以及复杂空间和语义关系的对象的复杂场景,既需要精确的对象放置,也需要对象之间的连贯相互作用.本文提出了一种名为 CompGen 的新型组合课程强化学习框架,以解决现有 T2I 模型中的组合性弱点.具体而言,我们利用场景图构建一种新的组合能力难度标准,并开发出相应的自适应马尔可夫链蒙特卡罗图样采样算法.这种难度感知的方法使我们能够合成逐步优化 T2I 模型的训练课程数据.我们将课程学习方法集成到基于组相对策略优化 (Group Relative Policy Optimization, GRPO) 中,并探讨不同的课程调度策略.我们的实验结果表明,在不同的课程调度策略下,CompGen 的规模曲线呈现出差异,其中易到难和高斯采样策略相较于随机采样在规模性能方面表现出色.大量实验表明,CompGen 在扩散模型和自回归 T2I 模型上均显著提升了组合生成能力,凸显了其在提升组合 T2I 生成系统方面的有效性.
引用
@article{arxiv.2511.18378,
title = {Synthetic Curriculum Reinforces Compositional Text-to-Image Generation},
author = {Shijian Wang and Runhao Fu and Siyi Zhao and Qingqin Zhan and Xingjian Wang and Jiarui Jin and Yuan Lu and Hanqian Wu and Cunjian Chen},
journal= {arXiv preprint arXiv:2511.18378},
year = {2025}
}