CatVTON:虚拟试穿中,拼接就是唯一需要的做法
计算机视觉与模式识别
2025-02-18 v2 人工智能
摘要
基于扩散模型的虚拟试穿方法虽然实现了逼真的效果,但往往需要额外的编码模块、大量的训练参数以及复杂的预处理步骤,这会增加训练和推理的负担。本文重新评估额外模块的必要性,并分析如何提高训练效率并减少推理过程中冗余步骤。在这些见解基础上,我们提出了CatVTON——一个简单高效的虚拟试穿扩散模型。它通过沿空间维度拼接方式,将面店或实际穿戴的任意类别服装传输到目标个体身上,作为扩散模型的输入。CatVTON的效率体现在三个方面:(1) 轻量化网络。CatVTON仅包含VAE和简化的去噪UNet,去除了冗余的图像和文本编码器以及跨注意力机制,仅需899.06M参数。(2) 参数高效训练。通过实验分析,我们发现自注意力模块是适配预训练扩散模型到虚拟试穿任务的关键,仅需49.57M训练参数即可实现高质量效果。(3) 简化推理。CatVTON消除了无用的预处理,如姿态估计、人体解析和标注生成,仅需人物图像和服装参考即可引导虚拟试穿过程,相较于其他基于扩散的方法,内存使用降低超过49%。大量实验表明,CatVTON在定性和定量结果上均优于基线方法,在仅使用73K样本的公开数据集训练的情况下,仍在野外场景中表现出强大的泛化能力。
引用
@article{arxiv.2407.15886,
title = {CatVTON: Concatenation Is All You Need for Virtual Try-On with Diffusion Models},
author = {Zheng Chong and Xiao Dong and Haoxiang Li and Shiyue Zhang and Wenqing Zhang and Xujie Zhang and Hanqing Zhao and Dongmei Jiang and Xiaodan Liang},
journal= {arXiv preprint arXiv:2407.15886},
year = {2025}
}
备注
Accepted by ICLR 2025