JCo-MVTON:基于联合可控多模态扩散Transformer的无掩码虚拟试穿框架
计算机视觉与模式识别
2025-08-26 v1
摘要
虚拟试穿系统长期受限于对人体遮罩的重依赖、对服装属性的细粒度控制有限以及对现实野外场景的泛化性差。为此,本文提出了JCo-MVTON(Jointly Controllable Multi-Modal Diffusion Transformer for Mask-Free Virtual Try-On),一种新型框架,通过集成基于扩散的图像生成与多模态条件融合来克服上述局限。该方法基于Multi-Modal Diffusion Transformer(MM-DiT)主干网络,直接将多样化控制信号(如参考人物图像和目标服装图像)整合到去噪过程中,通过专门的条件路径在自注意力层中融合特征。这种融合通过 refined positional encodings和 attention masks 进一步增强,实现精确的空间对齐和改进的服装-人物集成。为解决数据稀缺和质量问题,本文引入一种双向生成策略进行数据集构建:一个管道使用基于掩码的模型生成逼真的参考图像,而另一个对称的"Try-Off"模型以自监督方式训练,以恢复对应的服装图像。合成数据集经过严格的人工审核,允许迭代改进视觉保真度和多样性。实验表明,JCo-MVTON 在 DressCode 等公开基准上实现了最先进的性能,在定量指标和人类评估方面均显著优于现有方法。此外,它在现实世界应用中表现出强大的泛化能力,超越了商业系统。
关键词
引用
@article{arxiv.2508.17614,
title = {JCo-MVTON: Jointly Controllable Multi-Modal Diffusion Transformer for Mask-Free Virtual Try-on},
author = {Aowen Wang and Wei Li and Hao Luo and Mengxing Ao and Chenyu Zhu and Xinyang Li and Fan Wang},
journal= {arXiv preprint arXiv:2508.17614},
year = {2025}
}