中文

面向虚拟试穿的面向服装的扩散模型提升

计算机视觉与模式识别 2024-09-13 v1 多媒体

摘要

扩散模型已在众多图像合成任务中引发革命。然而,直接将扩散模型用于合成目标人物穿着给定在店服装的图像——即图像基虚拟试穿(VTON)任务——并不容易。难点在于,扩散过程不仅要生成目标人物的整体高保真照片实在图像,还要在局部保持给定服装的每一种外观和纹理细节。为此,我们构建一种新的扩散模型,称为GarDiff,通过对给定服装的基本视觉外观和详细纹理(即高频细节)进行放大引导,触发服装聚焦的扩散过程。GarDiff 首先改造预训练的潜在扩散模型,融合来自参考服装的CLIP和VAE 编码所提供的额外外观先验。同时,集成一种新型服装聚焦适配器到扩散模型的 UNet 中,追求与参考服装外观和人体姿态的局部分fine-grained对齐。我们特别设计一种针对合成服装的外观损失,以增强关键的高频细节。广泛的在VITON-HD和DressCode 数据集上的实验表明,GarDiff 在与当前先进VTON方法比较时表现优异。代码已公开available at: \href{https://github.com/siqi0905/GarDiff/tree/master}{https://github.com/siqi0905/GarDiff/tree/master}。

关键词

引用

@article{arxiv.2409.08258,
  title  = {Improving Virtual Try-On with Garment-focused Diffusion Models},
  author = {Siqi Wan and Yehao Li and Jingwen Chen and Yingwei Pan and Ting Yao and Yang Cao and Tao Mei},
  journal= {arXiv preprint arXiv:2409.08258},
  year   = {2024}
}

备注

ECCV 2024. Source code is available at https://github.com/siqi0905/GarDiff/tree/master