DS-VTON:一种用于虚拟试穿的增强型双尺度由粗到细框架
计算机视觉与模式识别
2025-10-07 v2
摘要
尽管近期取得了进展,但大多数现有的虚拟试穿方法仍难以同时解决两个核心挑战:准确将服装图像与目标人体对齐,以及保留细粒度的服装纹理和图案。这两个要求直接对应于由粗到细的生成范式,其中粗阶段处理结构对齐,细阶段恢复丰富的服装细节。受此观察启发,我们提出了 DS-VTON,一种增强型双尺度由粗到细框架,能够更有效地解决试穿问题。DS-VTON 包含两个阶段:第一阶段生成低分辨率试穿结果以捕捉服装与身体之间的语义对应关系,其中细节的减少有助于稳健的结构对齐。在第二阶段,混合-细化扩散过程通过噪声-图像混合细化尺度间的残差来重建高分辨率输出,强调纹理保真度并有效纠正低分辨率阶段的细粒度误差。此外,我们的方法采用完全无掩码的生成策略,消除了对人体解析图或分割掩码的依赖。大量实验表明,DS-VTON 不仅实现了 SOTA 性能,而且在多个标准虚拟试穿基准上的结构对齐和纹理保真度方面均持续且显著地超越了现有方法。
引用
@article{arxiv.2506.00908,
title = {DS-VTON: An Enhanced Dual-Scale Coarse-to-Fine Framework for Virtual Try-On},
author = {Xianbing Sun and Yan Hong and Jiahui Zhan and Jun Lan and Huijia Zhu and Weiqiang Wang and Liqing Zhang and Jianfu Zhang},
journal= {arXiv preprint arXiv:2506.00908},
year = {2025}
}