中文

Stitch:多模态扩散转换器的无训练位置控制

计算机视觉与模式识别 2025-10-01 v1 人工智能 机器学习

摘要

文本到图像(T2I)生成模型在近年来取得了快速进展,但准确捕捉如“above”或“to the right of”等空间关系仍是一个持久的挑战。早期方法通过外部位置控制改进了空间关系遵循,但随着架构演化以增强图像质量,这些技术与现代模型不再兼容。我们提出Stitch,这是一种将外部位置控制集成到多模态扩散转换器(MMDiT)中的无训练方法,通过自动生成的边界框实现。Stitch生成既在空间上准确又在视觉上令人满意的图像,通过在指定的边界框内生成单个对象并无缝拼接它们来实现。我们发现,针对性的注意力头捕获了在生成过程中隔离和切出单个对象的必要信息,无需完全完成图像即可实现。我们在PosEval上对Stitch进行评估,该基准为基于位置的T2I生成提供了五个新任务,扩展了Position概念超越基本的GenEval任务。PosEval表明,即使是顶尖模型在基于位置的生成方面仍有显著的提升空间。针对Qwen-Image、FLUX和SD3.5测试,Stitch始终提升基模型,FLUX在GenEval的Position任务上提升了218%,在PosEval上提升了206%。Stitch在Qwen-Image上实现了PosEval的最佳结果,超过前述模型提升了54%,全部在无需训练的情况下将位置控制集成到领先模型中完成。代码可在https://github.com/ExplainableML/Stitch获取。

关键词

引用

@article{arxiv.2509.26644,
  title  = {Stitch: Training-Free Position Control in Multimodal Diffusion Transformers},
  author = {Jessica Bader and Mateusz Pach and Maria A. Bravo and Serge Belongie and Zeynep Akata},
  journal= {arXiv preprint arXiv:2509.26644},
  year   = {2025}
}

备注

Preprint