基于注意力调整和空间控制的无训练多 ID 定制方法
计算机视觉与模式识别
2025-11-26 v1
摘要
多 ID 定制是计算机视觉中的一个有趣话题,近年来受到广泛关注。给定多个个体的 ID 图像,其目标是生成一幅无缝集成它们并保留各自身份的定制图像。与单 ID 定制相比,多 ID 定制更加困难,面临两个主要挑战。首先,由于多 ID 定制模型训练时是从裁剪的人体区域重建图像,推理时常遇到复制粘贴问题,导致生成质量较低。其次,该模型还存在文本可控性差的问题。生成结果不管是否符合输入文本的对齐情况,都简单地将多个人物组合成一幅图像。在本工作中,我们以无训练方式提出 MultiID 以解决这一挑战性任务。由于现有单 ID 定制模型存在复制粘贴问题较少, Our 核心思想是改造这些模型以实现多 ID 定制。为此,我们提出了一种 ID 解耦的交叉注意力机制,将不同的 ID 嵌入注入到相应的图像区域,从而生成多 ID 输出。为增强生成的可控性,我们引入了三个关键策略,即局部提示、深度引导的空间控制和扩展的自注意力,使生成结果更符合文本提示和 ID 图像。我们还小心构建了一个名为 IDBench 的基准进行评估。大量的定性和定量结果表明,MultiID 在解决上述两个挑战方面效果显著,其性能与甚至优于基于训练的多 ID 定制方法。
引用
@article{arxiv.2511.20401,
title = {A Training-Free Approach for Multi-ID Customization via Attention Adjustment and Spatial Control},
author = {Jiawei Lin and Guanlong Jiao and Jianjin Xu},
journal= {arXiv preprint arXiv:2511.20401},
year = {2025}
}