ODPG:以姿态引导条件装备扩散模型
计算机视觉与模式识别
2025-01-14 v1
摘要
虚拟试衣 (Virtual Try-On, VTON) 技术允许用户无需实际试穿即可可视化衣物穿在身上的效果,随着数字化和在线购物的兴起而备受关注。传统 VTON 方法通常使用生成对抗网络 (GAN) 和 Diffusion 模型,在实现高真实感和处理动态姿态方面面临挑战。本文引入了以姿态引导条件装备扩散模型 (Outfitting Diffusion with Pose Guided Condition, ODPG),这是一种在去噪过程中利用具有多条件输入的潜在扩散模型的新方法。通过将服装、姿态和外观图像转换为潜在特征,并在基于 UNet 的去噪模型中整合这些特征,ODPG 实现了在动态姿态人体图像上的非显式服装合成。我们在 FashionTryOn 和 DeepFashion 数据集子集上的实验表明,ODPG 利用端到端架构无需显式服装扭曲过程,即可生成在各种姿态下具有细粒度纹理细节的逼真 VTON 图像。未来的工作将集中于生成视频格式的 VTON 输出,以及将我们在方法部分详述的注意力机制应用于其他数据受限的领域。
引用
@article{arxiv.2501.06769,
title = {ODPG: Outfitting Diffusion with Pose Guided Condition},
author = {Seohyun Lee and Jintae Park and Sanghyeok Park},
journal= {arXiv preprint arXiv:2501.06769},
year = {2025}
}
备注
11 pages, 5 figures. Preprint submitted to VISAPP 2025: the 20th International Joint Conference on Computer Vision, Imaging and Computer Graphics Theory and Applications