中文

GraPE:用于组合性 T2I 合成的生成-规划-编辑框架

计算机视觉与模式识别 2025-03-12 v2

摘要

文本到图像 (T2I) 生成近年来在扩散模型方面取得了显著进展,使能够从文本提示生成照片般逼真的图像。尽管如此,现有方法仍面临在遵循复杂文本提示方面的挑战,尤其是那些需要组合性和多步骤推理的提示。对于此类复杂指令,SOTA 模型常常在忠实地建模对象属性和它们之间的关系方面出错。在本工作中,我们提出了一种替代范式用于 T2I 合成,将复杂多步骤生成任务分解为三个步骤:(a) 生成:我们首先使用现有的扩散模型生成图像;(b) 规划:我们利用多模态大语言模型 (MLLM) 来识别生成图像中以单个对象及其属性形式表达的错误,并产生以编辑计划形式表示的纠正步骤序列;(c) 编辑:我们利用现有的文本引导图像编辑模型依次执行我们的编辑计划,以获得对原始指令忠实的所需图像。我们方法的优势在于它是模块化的、无需训练的,并且可以应用于任何图像生成和编辑模型的组合。作为额外的贡献,我们还开发了一个能够进行组合性编辑的模型,这进一步帮助提高了我们所提出方法的整体准确性。我们的方法灵活地以推理时间计算量与性能在组合文本提示之间进行权衡。在3个基准和10个 T2I 模型(包括 DALLE-3 和最新的 -- SD-3.5-Large)上进行了大规模实验评估。我们的方法不仅提升了 SOTA 模型的性能(最多提升3个百分点),还缩小了较弱模型和较强模型之间的性能差距。\href\href{https://dair-iitd.github.io/GraPE/}{https://dair-iitd.github.io/GraPE/}

关键词

引用

@article{arxiv.2412.06089,
  title  = {GraPE: A Generate-Plan-Edit Framework for Compositional T2I Synthesis},
  author = {Ashish Goswami and Satyam Kumar Modi and Santhosh Rishi Deshineni and Harman Singh and Prathosh A. P and Parag Singla},
  journal= {arXiv preprint arXiv:2412.06089},
  year   = {2025}
}