MuGa-VTON:基于扩散变换器的多服装虚拟试穿
计算机视觉与模式识别
2025-08-13 v1
摘要
虚拟试穿旨在生成个人穿着理想服装的照片级图像,这一任务必须在保持个人身份和服装忠实度的同时为实际时尚零售和个性化应用提供支持。然而,现有方法通常分别处理上装和下装,依赖重型预处理,且常常无法保留人类特定线索,如纹身、配饰和身体形状,导致现实感和灵活性有限。为此,我们引入MuGa-VTON,一个统一的多服装扩散框架,能够在共享潜在空间中联合建模上装和下装以及人物身份。具体而言,我们提出了三个关键模块:用于捕获服装语义的 Garment Representation Module (GRM),用于编码身份和姿势线索的 Person Representation Module (PRM),以及集成服装、人物和文本提示特征的 A-DiT 融合模块。该架构支持基于提示的定制,允许用户通过最小输入对服装进行细粒度修改。在 VITON-HD 和 DressCode 数据集上的大量实验表明,MuGa-VTON 在定性和定量评估方面均优于现有方法,生成的高保真、身份保留结果符合实际虚拟试穿应用的需求。
引用
@article{arxiv.2508.08488,
title = {MuGa-VTON: Multi-Garment Virtual Try-On via Diffusion Transformers with Prompt Customization},
author = {Ankan Deria and Dwarikanath Mahapatra and Behzad Bozorgtabar and Mohna Chakraborty and Snehashis Chakraborty and Sudipta Roy},
journal= {arXiv preprint arXiv:2508.08488},
year = {2025}
}