中文

将视觉对应融入扩散模型以实现虚拟试穿

计算机视觉与模式识别 2025-05-23 v1 多媒体

摘要

扩散模型在虚拟试穿(VTON)任务中已展现出初步成功。典型的双分支架构包含两个 UNet,分别用于隐式服装变形和合成图像生成,已成为 VTON 任务的主流方案。然而,由于扩散模型固有的随机性,该问题在保持给定服装的形状和每个细节方面仍具有挑战性。为缓解此问题,我们首次提出利用视觉对应作为先验来引导扩散过程,而非简单地将整件服装作为外观参考输入 UNet。具体而言,我们将细粒度的外观和纹理细节解释为一组结构化语义点,并通过局部流变换将服装中的语义点与目标人物上的语义点进行匹配。这些二维点随后借助目标人物的深度/法线图增强为 3D 感知线索。该对应方式模仿了将服装穿在人体上的过程,而 3D 感知线索则作为语义点匹配来监督扩散模型训练。我们进一步设计了聚焦点的扩散损失,以充分利用语义点匹配。大量实验证明了我们方法在服装细节保持方面的强大能力,在 VITON-HD 和 DressCode 数据集上均取得了最先进的 VTON 性能。代码已公开:https://github.com/HiDream-ai/SPM-Diff。

关键词

引用

@article{arxiv.2505.16977,
  title  = {Incorporating Visual Correspondence into Diffusion Model for Virtual Try-On},
  author = {Siqi Wan and Jingwen Chen and Yingwei Pan and Ting Yao and Tao Mei},
  journal= {arXiv preprint arXiv:2505.16977},
  year   = {2025}
}

备注

ICLR 2025. Code is publicly available at: https://github.com/HiDream-ai/SPM-Diff