从衣柜到画布:用于部件级可控人体图像生成的衣柜多联画LoRA
计算机视觉与模式识别
2025-07-22 v2
摘要
最近的扩散模型通过学习特定主体实现个性化,使得学习到的属性能够被整合到生成的图像中。然而,由于需要精确且一致的属性保持(例如身份、服装细节),个性化人体图像生成仍然具有挑战性。现有的主体驱动图像生成方法通常需要(1)为每个新主体使用少量图像进行推理时微调,或(2)进行大规模数据集训练以实现泛化。这两种方法计算成本高昂,且不适用于实时应用。为解决这些限制,我们提出了Wardrobe Polyptych LoRA,一种用于个性化人体图像生成的新型部件级可控模型。通过仅训练LoRA层,我们的方法消除了推理时的计算负担,同时确保了对未见主体的高保真合成。我们的关键思想是让生成过程以主体的衣柜为条件,并利用空间参考来减少信息损失,从而提高保真度和一致性。此外,我们引入了一种选择性主体区域损失,鼓励模型在训练期间忽略部分参考图像。我们的损失确保生成的图像更好地与文本提示对齐,同时保持主体完整性。值得注意的是,我们的Wardrobe Polyptych LoRA在推理阶段不需要额外参数,并使用在少量训练样本上训练的单个模型进行生成。我们构建了一个新的数据集和基准,专门用于个性化人体图像生成。大量实验表明,我们的方法在保真度和一致性上显著优于现有技术,实现了逼真且保持身份的全身体合成。
引用
@article{arxiv.2507.10217,
title = {From Wardrobe to Canvas: Wardrobe Polyptych LoRA for Part-level Controllable Human Image Generation},
author = {Jeongho Kim and Sunghyun Park and Hyoungwoo Park and Sungrack Yun and Jaegul Choo and Seokeon Choi},
journal= {arXiv preprint arXiv:2507.10217},
year = {2025}
}
备注
10 pages, 8 figures