面向虚拟试穿的可信潜在扩散模型 (FLDM-VTON)
计算机视觉与模式识别
2024-05-21 v3
摘要
尽管潜在扩散模型在虚拟试穿 (VTON) 方法中展现了惊人的生成性能,但它们缺乏对服装细节(如风格、图案和文字)的可信性。为缓解由扩散随机性和潜在监督导致的这些问题,我们提出了一种 novel 可信潜在扩散模型用于 VTON,称为 FLDM-VTON。FLDM-VTON 在三个方面显著改进了传统潜在扩散过程:首先,我们提出将变形后服装作为起始点和局部条件,为模型提供可信服装先验;其次,我们引入 novel 服装展平网络以约束生成试穿图像,提供服装一致性可信监督;最后,我们设计服装后验抽样以实现可信推断,从而显著提升模型性能,超越传统服装中性高斯抽样。广泛的实验结果表明,我们的 FLDM-VTON 在 VITON-HD 和 Dress Code 数据集上均优于最先进的基准方法,能够生成具有可信服装细节的照片级试穿图像。
引用
@article{arxiv.2404.14162,
title = {FLDM-VTON: Faithful Latent Diffusion Model for Virtual Try-on},
author = {Chenhui Wang and Tao Chen and Zhihao Chen and Zhizhong Huang and Taoran Jiang and Qi Wang and Hongming Shan},
journal= {arXiv preprint arXiv:2404.14162},
year = {2024}
}
备注
Accepted by IJCAI 2024