FashionComposer:组合化时尚图像生成
计算机视觉与模式识别
2024-12-20 v2
摘要
我们提出了 FashionComposer,用于组合化时尚图像生成。与以往方法不同,FashionComposer 具有高度灵活性。它接收多模态输入(即文本提示、参数化人体模型、服装图像和面部图像),并支持个性化人物的外观、姿态和体型,以及一次性分配多件服装。为了实现这一点,我们首先开发了一个能够处理多种输入模态的通用框架。我们构建了规模化的训练数据,以增强模型鲁棒的组合能力。为了无缝地容纳多个参考图像(服装和面部),我们将这些参考对象作为“资产库”组织在一张图像中,并采用参考 UNet 来提取外观特征。为了将外观特征注入生成结果中的正确像素,我们提出了主体绑定注意力。它将来自不同“资产”的外观特征与相应的文本特征进行绑定。通过这种方式,模型能够根据语义理解每个资产,从而支持任意数量和类型的参考图像。作为一个综合解决方案,FashionComposer 还支持许多其他应用,如人物相册生成、多样化的虚拟试穿任务等。
引用
@article{arxiv.2412.14168,
title = {FashionComposer: Compositional Fashion Image Generation},
author = {Sihui Ji and Yiyang Wang and Xi Chen and Xiaogang Xu and Hao Luo and Hengshuang Zhao},
journal= {arXiv preprint arXiv:2412.14168},
year = {2024}
}
备注
https://sihuiji.github.io/FashionComposer-Page