MOSAIC:基于语义对应对齐与解�odisement 的多主体个性化生成
计算机视觉与模式识别
2025-09-03 v1
摘要
多主体个性化生成在合成以多个参考主体为条件的图像时,面临身份保真性和语义连贯性的独特挑战。现有方法常因不足地建模不同主体在共享表示空间内的相互作用方式,而导致身份混合和属性泄漏。我们提出 MOSAIC,一个以表示为中心的框架,通过显式语义对应和正交特征解�odisement 重新思考多主体生成。我们的关键洞察是,多主体生成需要在表示层面进行精确的语义对齐——即明确知道生成图像中哪些区域应注意每个参考的哪些部分。为实现这一点,我们构建了一个 SemAlign-MS 数据集,提供了多个参考主体与目标图像之间细粒度语义对应关系,这在该领域以前难以获得。基于此,我们提出了语义对应注意力损失,以强化精确的点到点语义对齐,确保来自每个参考的高一致性。此外,我们开发了多参考解�odisement 损失,将不同主体推向正交注意力子空间,防止特征干扰,同时保留 individual identity characteristics。广泛的实验表明,MOSAIC 在多个基准测试上实现了最佳性能。值得注意的是,现有方法通常在超过 3 个主体时性能会下降,而 MOSAIC 能够保持 4+ 个参考主体的高保真度,为复杂的多主体合成应用开辟了新的可能性。
关键词
引用
@article{arxiv.2509.01977,
title = {MOSAIC: Multi-Subject Personalized Generation via Correspondence-Aware Alignment and Disentanglement},
author = {Dong She and Siming Fu and Mushui Liu and Qiaoqiao Jin and Hualiang Wang and Mu Liu and Jidong Jiang},
journal= {arXiv preprint arXiv:2509.01977},
year = {2025}
}