基于构件分解的长文本到图像生成
计算机视觉与模式识别
2026-04-21 v1 人工智能
摘要
虽然现代文本到图像(T2I)模型在处理复杂提示词时表现优异,但在输入为描述性段落时难以捕捉关键细节。这种局限性源于以简洁标题为主导的训练分布。现有方法尝试通过微调T2I模型以适应长提示词,或将超大输入投影到常规提示空间,但后者会牺牲保真度。我们提出了一种名为 PRISM(Prompt Refraction for Intricate Scene Modeling)的构件化方法,使预训练的T2I模型能够处理长序列输入。PRISM 使用轻量模块从长提示中提取组成表示,T2I模型对每个组件独立进行噪声预测,其输出通过能量基联合方式合并为单一去噪步骤。我们在多种模型架构上进行评估,表现与在相同训练数据上微调的模型相当。此外,PRISM 在公开基准测试中对超过 500 个 token 的提示词 outperform baseline 模型 7.4%。
引用
@article{arxiv.2604.18258,
title = {Long-Text-to-Image Generation via Compositional Prompt Decomposition},
author = {Jen-Yuan Huang and Tong Lin and Yilun Du},
journal= {arXiv preprint arXiv:2604.18258},
year = {2026}
}
备注
Accepted to the Fourteenth International Conference on Learning Representations (ICLR 2026)