中文

StableVITON:基于潜在扩散模型学习语义对应的虚拟试衣

计算机视觉与模式识别 2023-12-05 v1

摘要

给定一张服装图像和一张人物图像,基于图像的虚拟试衣旨在生成一张既自然又能准确反映服装图像特征的定制图像。在本工作中,我们旨在扩展预训练扩散模型的适用性,使其能够独立用于虚拟试衣任务。主要挑战在于在有效利用预训练模型强大生成能力的同时保留服装细节。为了解决这些问题,我们提出了 StableVITON,以端到端的方式在预训练扩散模型的潜在空间中学习服装与人体之间的语义对应。我们所提出的零交叉注意力块不仅能通过学习语义对应来保留服装细节,还能在形变过程中利用预训练模型的固有知识生成高保真图像。通过我们提出的新颖的注意力全变分损失以及数据增强,我们获得了清晰的注意力图,从而更精确地表示服装细节。StableVITON 在定性与定量评估中均优于基线方法,在任意人物图像上展现出令人期待的质量。代码已公开于 https://github.com/rlawjdghek/StableVITON。

关键词

引用

@article{arxiv.2312.01725,
  title  = {StableVITON: Learning Semantic Correspondence with Latent Diffusion Model for Virtual Try-On},
  author = {Jeongho Kim and Gyojung Gu and Minho Park and Sunghyun Park and Jaegul Choo},
  journal= {arXiv preprint arXiv:2312.01725},
  year   = {2023}
}

备注

17 pages