渐进式提示细化:提高文本到图像生成模型对齐效果
计算机视觉与模式识别
2025-06-02 v4 人工智能
摘要
文本到图像生成模型常在处理详细的长提示时,尤其是涉及复杂场景、具有不同视觉特征的多样对象及其空间关系时,难以实现良好的对齐。本文提出 SCoPE(Scheduled interpolation of Coarse-to-fine Prompt Embeddings,调度式粗到细提示嵌入插值),这是一种无需训练的方法,通过逐步细化输入提示来提高文本到图像的对齐度。给定详细的输入提示,我们首先将其分解为多个子提示,这些子提示从描述宽泛场景布局演进为高度精细的细节。在推理过程中,我们在这些子提示之间进行插值,从而逐步将更细致的细节引入生成图像中。我们的无训练即插即用的方法显著提升了提示对齐效果,在 GenAI-Bench 数据集中 83% 的提示上相对于 Stable Diffusion 基线实现超过 +8 的 VQA 分数提升。
引用
@article{arxiv.2503.17794,
title = {Progressive Prompt Detailing for Improved Alignment in Text-to-Image Generative Models},
author = {Ketan Suhaas Saichandran and Xavier Thomas and Prakhar Kaushik and Deepti Ghadiyaram},
journal= {arXiv preprint arXiv:2503.17794},
year = {2025}
}
备注
Accepted at CVPR 2025 workshops (AI4CC (oral) & GMCV (poster))