中文

AnyMS:面向布局引导且无需训练的多主体定制的自底向上注意力解耦

计算机视觉与模式识别 2026-01-05 v2 人工智能

摘要

多主体定制旨在合成多个用户指定的主体以形成连贯的图像。为解决主体缺失或冲突等问题,近期研究引入布局引导以提供明确的空间约束。然而,现有方法仍难以平衡三个关键目标:文本对齐、主体身份保持和布局控制,同时依赖额外训练进一步限制了其可扩展性和效率。在本文中,我们提出了 AnyMS,一个面向布局引导的无需训练的多主体定制框架。AnyMS 利用三个输入条件:文本提示、主体图像和布局约束,引入自底向上的双层注意力解耦机制,以在生成过程中协调它们的集成。具体而言,全局解耦分离文本与视觉条件之间的交叉注意力,以确保文本对齐。局部解耦将每个主体的注意力限制在其指定区域,从而防止主体冲突,确保身份保持和布局控制。此外,AnyMS 使用预训练的图像适配器提取与扩散模型对齐的主体特定特征,无需主体学习或适配器调优。大量实验表明,AnyMS 实现了最先进的性能,支持复杂构图并可扩展至更多主体。

关键词

引用

@article{arxiv.2512.23537,
  title  = {AnyMS: Bottom-up Attention Decoupling for Layout-guided and Training-free Multi-subject Customization},
  author = {Binhe Yu and Zhen Wang and Kexin Li and Yuqian Yuan and Wenqiao Zhang and Long Chen and Juncheng Li and Jun Xiao and Yueting Zhuang},
  journal= {arXiv preprint arXiv:2512.23537},
  year   = {2026}
}