虚拟试穿中关键要素是什么?基于Dual-UNet扩散模型的衣物重建
计算机视觉与模式识别
2026-04-13 v1
摘要
虚拟试穿(VTON)取得了快速的进展,为生成式时尚任务提供了坚实的基础。然而,逆问题——虚拟试脱(VTOFF)——即从drapped-on图像中重建标准衣物——仍是一个鲜为人知的领域,与VTON这一密集研究的领域不同。本文旨在通过研究和改编VTON和通用潜在扩散模型(LDM)中的各种扩散策略,为VTOFF建立稳健的架构基础。我们聚焦于Dual-UNet扩散模型架构,分析三个设计轴向:(i)生成主干:比较Stable Diffusion变体;(ii)条件控制:消融不同的mask设计、masked/unmasked输入用于图像条件,以及高层语义特征的实用性;(iii)损失函数与训练策略:评估辅助注意力损失、感知目标和多阶段课程计划的影响。大量实验揭示了各种配置选项之间的权衡。在VITON-HD和DressCode数据集上,我们的框架在主要指标DISTS上实现了9.5%的提升,在LPIPS、FID、KID和SSIM上实现了具竞争力的性能,为未来的虚拟试脱研究提供了更强的基线和见解。
引用
@article{arxiv.2604.08716,
title = {What Matters in Virtual Try-Off? Dual-UNet Diffusion Model For Garment Reconstruction},
author = {Loc-Phat Truong and Meysam Madadi and Sergio Escalera},
journal= {arXiv preprint arXiv:2604.08716},
year = {2026}
}