中文

M&M VTO:多件服装虚拟试穿与编辑

计算机视觉与模式识别 2024-06-10 v1 图形学

摘要

我们提出了M&M VTO(Mix and Match Virtual Try-On),一种基于扩散模型的多件服装虚拟试穿方法。该方法接受多件服装图像、服装布局文本描述以及人物图像作为输入。例如,输入包括:一件衬衫的图像、一条裤子的图像、"卷起袖口、衬衫塞进裤子"的文本描述,以及一个人的图像。输出是将这些服装(按所需布局)显示在给定人物身上的可视化效果。我们方法的关键贡献包括:1)一个单阶段基于扩散的模型,无需超分辨率级联,能够在1024x512分辨率下混合搭配多件服装,同时保留并变形精细的服装细节;2)架构设计(VTO UNet Diffusion Transformer)用于分离去噪过程与人物相关特征,允许针对身份保留实现高度有效的微调策略(每个个体仅6MB模型大小,而使用如dreambooth的微调则需4GB);解决当前虚拟试穿方法中常见的身份丢失问题;3)通过文本输入实现多件服装布局控制,特别针对虚拟试穿任务在PaLI-3上进行微调。实验结果表明,M&M VTO在定性和定量分析方面均实现了最先进的性能,同时为通过语言引导的多件服装试穿开辟了新的机遇。

关键词

引用

@article{arxiv.2406.04542,
  title  = {M&M VTO: Multi-Garment Virtual Try-On and Editing},
  author = {Luyang Zhu and Yingwei Li and Nan Liu and Hao Peng and Dawei Yang and Ira Kemelmacher-Shlizerman},
  journal= {arXiv preprint arXiv:2406.04542},
  year   = {2024}
}

备注

CVPR 2024 Highlight. Project website: https://mmvto.github.io/