中文

MC-VTON:最小控制虚拟试穿扩散变换器

计算机视觉与模式识别 2025-01-13 v2

摘要

基于扩散模型的虚拟试穿方法实现逼真的试穿效果。它们使用额外的参考网络或额外的图像编码器来处理多个条件图像输入,这增加了预处理的复杂度和额外的计算成本。此外,它们需要超过25个推理步骤,导致推理时间更长。本文在扩散变换器(DiT)发展的基础上,重新思考额外参考网络或图像编码器的必要性,提出MC-VTON,该方法利用DiT的内在主干结构无缝集成最小条件试穿输入。与现有方法相比,MC-VTON的优势体现在四个方面:(1)细节保真度更高。我们的DiT-based MC-VTON在保留细粒度细节方面表现更佳。(2)网络和输入更简化。我们移除任何额外的参考网络或图像编码器。我们也移除不必要的条件,如长提示、姿态估计、人体解析和深度图。我们只需要蒙版人物图像和衣物图像。(3)参数效率更高。为了处理试穿任务,我们仅使用39.7M额外参数(相当于主干参数的0.33%)对FLUX.1-dev进行微调。(4)推理步骤更少。我们对MC-VTON应用蒸馏扩散,仅需8个步骤即可生成逼真的试穿图像,仅需86.8M额外参数(相当于主干参数的0.72%)。实验表明,MC-VTON在更少的条件输入、可训练参数和推理步骤上实现了优于基线方法的优越的定性和定量结果。

关键词

引用

@article{arxiv.2501.03630,
  title  = {MC-VTON: Minimal Control Virtual Try-On Diffusion Transformer},
  author = {Junsheng Luan and Guangyuan Li and Lei Zhao and Wei Xing},
  journal= {arXiv preprint arXiv:2501.03630},
  year   = {2025}
}