中文

ComposeAnything:用于文本到图像生成的复合物体先验

计算机视觉与模式识别 2025-06-02 v1

摘要

从涉及复杂且新颖物体排列的文本生成图像,对当前的文本到图像(T2I)模型仍是一项重大挑战。尽管先前基于布局的方法利用二维布局的空间约束改善了物体排列,但它们往往难以捕捉三维定位,并牺牲了质量与连贯性。在本工作中,我们引入了 ComposeAnything,一种无需重新训练现有 T2I 模型即可改善组合图像生成的新框架。该方法首先利用 LLM 的思维链推理能力,从文本生成 2.5D 语义布局,该布局由包含深度信息与详细描述的二维物体边界框构成。基于此布局,我们生成一个空间与深度感知的粗略物体组合,以捕捉预期的构图,作为强有力且可解释的先验,替代基于扩散的 T2I 模型中的随机噪声初始化。该先验通过物体先验强化与空间控制去噪引导去噪过程,实现组合物体与连贯背景的无缝生成,同时允许对不准确的先验进行细化。ComposeAnything 在 T2I-CompBench 和 NSR-1K 基准测试中,针对包含二维/三维空间排列、高物体数量及超现实构图的提示词,均优于现有方法。人工评估进一步表明,我们的模型生成的图像质量高,且构图忠实反映了文本内容。

关键词

引用

@article{arxiv.2505.24086,
  title  = {ComposeAnything: Composite Object Priors for Text-to-Image Generation},
  author = {Zeeshan Khan and Shizhe Chen and Cordelia Schmid},
  journal= {arXiv preprint arXiv:2505.24086},
  year   = {2025}
}