重思量化虚拟试穿中的服装条件化
计算机视觉与模式识别
2025-11-25 v1 人工智能
摘要
虚拟试穿(VTON)是合成穿着目标服装的人物图像的任务,基于人物图像和服装图像进行条件化。虽然基于扩散的 VTON 模型采用双 UNet 架构显示出优于单 UNet 模型的优异保真度,但因其庞大的结构导致实际计算和内存开销。本研究通过可视化分析和理论分析,推导出关于条件化 Denoising 过程学习上下文特征的三个假设。基于这些假设,我们开发了 Re-CatVTON,一个高性能的单 UNet 模型。我们进一步通过针对 VTON 空间拼接条件化设计的修改分类器自由引导策略,以及直接注入源自干净服装潜在的目标服装潜在(由干净服装潜在派生),以防止预测误差的累积。所提出的 Re-CatVTON 相较于其前身 CatVTON 显著提升了性能,同时仅在计算和内存方面略低于高性能 Dual UNet 模型 Leffa。我们的结果在 FID、KID 和 LPIPS 上实现了改进的得分,而在 SSIM 上仅出现轻微下降,为单 UNet VTON 模型建立了新的效率-性能权衡。
引用
@article{arxiv.2511.18775,
title = {Rethinking Garment Conditioning in Diffusion-based Virtual Try-On},
author = {Kihyun Na and Jinyoung Choi and Injung Kim},
journal= {arXiv preprint arXiv:2511.18775},
year = {2025}
}
备注
15 pages (including references and supplementary material), 10 figures, 7 tables. Code and pretrained models will be released