中文

改进扩散模型以实现野外真实的虚拟试穿

计算机视觉与模式识别 2024-07-30 v3

摘要

本文考虑基于图像的虚拟试穿任务,即给定分别描绘人物和服装的一对图像,渲染出该人物穿着精选服装的图像。先前的工作调整了现有的基于示例的修复扩散模型用于虚拟试穿,以提高生成视觉效果的自然度(相较于其他方法,如基于 GAN 的方法),但它们未能保留服装的身份特征。为克服这一局限,我们提出了一种新颖的扩散模型,提高了服装保真度并生成真实的虚拟试穿图像。我们的方法称为 IDM-VTON,使用两个不同的模块对服装图像的语义进行编码;给定扩散模型的基础 UNet,1) 将从视觉编码器提取的高级语义融合到交叉注意力层,然后 2) 将从并行 UNet 提取的低级特征融合到自注意力层。此外,我们为服装和人物图像提供了详细的文本提示,以增强生成视觉效果的真实性。最后,我们提出了一种使用人物 - 服装图像对的定制方法,显著提高了保真度和真实性。实验结果表明,无论是在定性还是定量方面,我们的方法在保留服装细节和生成真实虚拟试穿图像方面均优于先前的方法(包括基于扩散和基于 GAN 的方法)。此外,所提出的定制方法在现实场景中展示了其有效性。更多可视化结果可在我们的项目页面查看:https://idm-vton.github.io

关键词

引用

@article{arxiv.2403.05139,
  title  = {Improving Diffusion Models for Authentic Virtual Try-on in the Wild},
  author = {Yisol Choi and Sangkyung Kwak and Kyungmin Lee and Hyungwon Choi and Jinwoo Shin},
  journal= {arXiv preprint arXiv:2403.05139},
  year   = {2024}
}

备注

ECCV 2024