基于注意力专长的扩散转换器多实例综合的层次化与分步层级调优
计算机视觉与模式识别
2025-04-22 v2
摘要
文本到图像(T2I)生成模型在多实例综合(MIS)任务中常常难以准确描绘基于复杂提示中各个特征细节的多个独立实例。传统的 UNet 架构如 SD v1.5/SDXL 的 MIS 控制方法难以适应依赖于图像与文本标记集成注意力机制的 DiT 模型,如 FLUX 和 SD v3.5。为提升 DiT 的 MIS 能力,我们首先分析了 DiT 中的混合注意力机制。我们的标记级和层级注意力图分析揭示了层次化响应结构:实例标记在早期层面主导,背景标记在中期层面占主导,属性标记在后期层面占主导。基于此观察,我们提出一种基于层次化和分步层级注意力专长调优(AST)的无训练方法,用于增强 DiT 模型的 MIS 能力。AST 在不同层和步骤的注意力图中放大关键区域,抑制无关区域,依据层次化结构引导,以实现对复杂提示的层次化解耦。我们使用升级后的基于草图的布局用于 T2I-CompBench 和定制复杂场景进行评估。定量和定性结果均确认该方法提升了复杂布局生成,确保了 MIS 中精确的实例定位和属性表示。
引用
@article{arxiv.2504.10148,
title = {Hierarchical and Step-Layer-Wise Tuning of Attention Specialty for Multi-Instance Synthesis in Diffusion Transformers},
author = {Chunyang Zhang and Zhenhong Sun and Zhicheng Zhang and Junyan Wang and Yu Zhang and Dong Gong and Huadong Mo and Daoyi Dong},
journal= {arXiv preprint arXiv:2504.10148},
year = {2025}
}