中文

面向风格一致的多目标生成中的局部提示适配

计算机视觉与模式识别 2025-08-19 v2 人工智能 多智能体系统

摘要

扩散模型已成为文本到图像生成中强大的基础架构,能够从自然语言提示中生成高质量视觉效果。然而,当提示中包含多个目标及全局或局部风格指令时,输出常在风格上偏离且失去空间一致性,限制了其在受控、风格一致场景生成中的可靠性。我们提出局部提示适配 (LPA) 方法,这是一种轻量级、无需训练的方法,将提示拆分为内容标记与风格标记,随后在选定时间步将其选择性注入到U-Net的注意力层中。通过在去噪过程中早期对对象标记进行条件化、晚期对风格标记进行注入,LPA在不增加额外训练成本的情况下提升了布局控制与风格统一性。我们对解析器设置和注入窗口进行了大量消融实验,发现最佳配置——仅使用LPA晚期注入且在300-650步窗口内注入——能在提示对齐与风格一致性之间提供最佳平衡。在T2I基准测试中,LPA相对于vanilla SDXL提升+0.41%,相对于SD1.5提升+0.34%,且无损失。 在我们自建的50个提示风格丰富基准上,LPA相对于基线在CLIP提示对齐上提升+0.09%,在CLIP风格对齐上提升+0.08%。该方法具有模型无关性,集成简单,只需更改一个配置即可,使其成为受控、风格一致多目标生成的实用选择。

关键词

引用

@article{arxiv.2507.20094,
  title  = {Local Prompt Adaptation for Style-Consistent Multi-Object Generation in Diffusion Models},
  author = {Ankit Sanjyal},
  journal= {arXiv preprint arXiv:2507.20094},
  year   = {2025}
}

备注

10 Pages,10 figures, pre-print