基于个人化多件服装的可控人类图像生成
计算机视觉与模式识别
2025-04-02 v3
摘要
我们提出了 BootComp,一个基于文本到图像扩散模型的新框架,用于具有多个参考服装的可控人类图像生成。主要瓶颈在于数据获取:为训练收集大量高质量参考服装图像的挑战大,理想情况下,需要手动收集每个人身上的每件服装照片。为此,我们提出了数据生成管道,通过引入模型从每个人图像中提取任何参考服装图像来构建大型人类与多件服装配对的合成数据集。为确保数据质量,我们还提出了基于衡量服装在人类图像中呈现方式与提取服装之间感知相似性的过滤策略来删除不可接受的生成数据。最后,利用构建的合成数据集,我们训练了一个采用两个平行去噪路径的扩散模型,这些路径将多个服装图像作为条件来生成人类图像,同时保持其细粒度细节。我们进一步通过将其适用于不同的参考基生成方法来展示该框架的广泛适用性,包括虚拟试穿,以及使用其他条件(如姿态、面部等)进行可控人类图像生成。
引用
@article{arxiv.2411.16801,
title = {Controllable Human Image Generation with Personalized Multi-Garments},
author = {Yisol Choi and Sangkyung Kwak and Sihyun Yu and Hyungwon Choi and Jinwoo Shin},
journal= {arXiv preprint arXiv:2411.16801},
year = {2025}
}
备注
CVPR 2025. Project page: https://omnious.github.io/BootComp