中文

MultiCrafter:通过解耦注意力和身份感知偏好对齐实现高保真多主体生成

计算机视觉与模式识别 2025-11-25 v2

摘要

多主体图像生成旨在合成用户提供的主体于单个图像中,同时保持主体保真度、确保提示一致性并与人类审美偏好保持一致。现有的基于 In-Context-Learning 的方法受限于高度耦合的训练范式。这些方法试图在单一训练阶段同时实现高主体保真度和多维人类偏好对齐,依赖单一、间接的重建损失,难以同时满足这两个目标。为此,我们提出MultiCrafter,一个将此任务解耦为两个 distinct 训练阶段的框架。首先,在预训练阶段,我们引入显式的位置监督机制有效解决注意力漏出问题,大幅提升主体保真度。其次,在后训练阶段,我们提出身份保持偏好优化(Identity-Preserving Preference Optimization),这是一种新的在线强化学习框架。我们采用匈牙利匹配算法的评分机制,准确评估多主体保真度,使模型能够在确保第一阶段所达成的主体保真度的同时,针对审美和提示对齐进行优化。实验验证了我们的解耦框架在提升主体保真度方面显著有效,同时更好地与人类偏好保持一致。

关键词

引用

@article{arxiv.2509.21953,
  title  = {MultiCrafter: High-Fidelity Multi-Subject Generation via Disentangled Attention and Identity-Aware Preference Alignment},
  author = {Tao Wu and Yibo Jiang and Yehao Lu and Zhizhong Wang and Zeyi Huang and Zequn Qin and Xi Li},
  journal= {arXiv preprint arXiv:2509.21953},
  year   = {2025}
}

备注

Project Page: https://wutao-cs.github.io/MultiCrafter/