基于推理时缩放的组合式图像合成
计算机视觉与模式识别
2026-03-30 v2 人工智能
摘要
尽管现代文本到图像模型具有令人印象深刻的逼真度,但它们仍然难以处理组合性问题,常常无法准确渲染物体数量、属性和空间关系。为了应对这一挑战,我们提出了一种无需训练的框架,该框架将面向对象的方法与自我精炼相结合,以提高布局忠实度,同时保持美学质量。具体来说,我们利用大型语言模型(LLM)从输入提示中合成显式布局,并将这些布局注入图像生成过程,其中面向对象的视觉语言模型(VLM)评判器对多个候选结果进行重新排序,以迭代地选择与提示最对齐的结果。通过将显式布局锚定与基于自我精炼的推理时缩放统一起来,与最近的文本到图像模型相比,我们的框架实现了更强的场景与提示对齐。代码可在 https://github.com/gcl-inha/ReFocus 获取。
引用
@article{arxiv.2510.24133,
title = {Compositional Image Synthesis with Inference-Time Scaling},
author = {Minsuk Ji and Sanghyeok Lee and Namhyuk Ahn},
journal= {arXiv preprint arXiv:2510.24133},
year = {2026}
}
备注
projcet page: https://github.com/gcl-inha/ReFocus