面向文本到图像扩散模型的训练-free 细节增强器 Detail++
计算机视觉与模式识别
2025-07-25 v1 人工智能
摘要
近期的文本到图像(T2I)生成技术取得了显著的视觉成果。然而,这些模型在处理复杂提示时仍面临重大挑战,尤其是涉及多个具有不同属性的主体的提示。灵感来自人类绘图过程,即先描绘构图,再逐步添加细节,我们提出了 Detail++,一个训练-free 框架,引入了新的渐进细节注入(PDI)策略以解决这一限制。具体而言,我们将复杂提示分解为一序列简化子提示,分阶段引导生成过程。该分阶段生成利用自注意力内在的布局控制能力,首先确保全局构图,然后进行精确细化。为实现属性与对应主体之间的准确绑定,我们利用交叉注意力机制,并进一步在测试时引入中心对齐损失以减少绑定噪声并增强属性一致性。在 T2I-CompBench 和新构建的风格构图基准上进行的广泛实验表明,Detail++ 在处理多个对象和复杂风格条件的场景时显著优于现有方法。
引用
@article{arxiv.2507.17853,
title = {Detail++: Training-Free Detail Enhancer for Text-to-Image Diffusion Models},
author = {Lifeng Chen and Jiner Wang and Zihao Pan and Beier Zhu and Xiaofeng Yang and Chi Zhang},
journal= {arXiv preprint arXiv:2507.17853},
year = {2025}
}