MF-VITON:基于最少输入的高保真无掩码虚拟试穿
计算机视觉与模式识别
2025-03-12 v1
摘要
虚拟试穿(VITON)领域的最新进展显著提升了图像真实感和服装细节保持,这得益于强大的文本到图像(T2I)扩散模型。然而,现有方法通常依赖用户提供的掩码,引入复杂性并因不完美的输入导致性能下降,如图 1(a) 所示。为解决这一问题,我们提出了无掩码虚拟试穿(MF-VITON)框架,仅使用单张人物图像和目标服装即可实现逼真的虚拟试穿,无需辅助掩码。我们的方法引入了一种新颖的两阶段流水线:(1)我们利用现有的基于掩码的 VITON 模型合成高质量数据集。该数据集包含多样化、真实的人物图像与对应服装对,并经过背景增强以模拟真实场景。(2)预训练的基于掩码的模型在该生成数据集上进行微调,使服装迁移不再依赖掩码。该阶段简化了输入要求,同时保持了服装纹理和形状的保真度。我们的框架在服装迁移准确性和视觉真实感方面达到了最先进的(SOTA)性能。值得注意的是,所提出的无掩码模型显著优于现有的基于掩码的方法,树立了新的基准,并展示了相对于先前方法的实质性领先。更多细节请访问我们的项目页面:https://zhenchenwan.github.io/MF-VITON/。
引用
@article{arxiv.2503.08650,
title = {MF-VITON: High-Fidelity Mask-Free Virtual Try-On with Minimal Input},
author = {Zhenchen Wan and Yanwu xu and Dongting Hu and Weilun Cheng and Tianxi Chen and Zhaoqing Wang and Feng Liu and Tongliang Liu and Mingming Gong},
journal= {arXiv preprint arXiv:2503.08650},
year = {2025}
}
备注
The project page is available at: https://zhenchenwan.github.io/MF-VITON/