中文

OOTDiffusion:基于服装融合潜扩散的可控虚拟试穿

计算机视觉与模式识别 2024-03-08 v2

摘要

我们提出了 OOTDiffusion,这是一种用于逼真且可控的基于图像的虚拟试穿(VTON)的新型网络架构。我们利用预训练潜扩散模型的力量,设计了一个服装 UNet 来学习服装细节特征。无需冗余的扭曲过程,通过我们在去噪 UNet 自注意力层中提出的服装融合,服装特征与目标人体精确对齐。为了进一步增强可控性,我们在训练过程中引入了服装丢弃(outfitting dropout),使我们能够通过无分类器引导调整服装特征的强度。我们在 VITON-HD 和 Dress Code 数据集上的综合实验表明,OOTDiffusion 能够为任意人体和服装图像高效生成高质量的试穿结果,在真实感和可控性方面均优于其他 VTON 方法,标志着虚拟试穿领域的令人印象深刻的突破。我们的源代码可在 https://github.com/levihsu/OOTDiffusion 获取。

关键词

引用

@article{arxiv.2403.01779,
  title  = {OOTDiffusion: Outfitting Fusion based Latent Diffusion for Controllable Virtual Try-on},
  author = {Yuhao Xu and Tao Gu and Weifeng Chen and Chengcai Chen},
  journal= {arXiv preprint arXiv:2403.01779},
  year   = {2024}
}