高效无编码器姿态条件化与姿态控制用于虚拟试穿
计算机视觉与模式识别
2025-09-25 v1
摘要
随着在线购物的持续增长,虚拟试穿(VTON)技术的需求激增,使顾客能够通过将产品图像叠加到自身照片上来可视化产品。有效VTON的一个必要但具有挑战性的条件是姿态控制,它确保产品与用户身体的准确对齐,同时支持多样化的方向以提供更沉浸的体验。然而,将姿态条件纳入VTON模型面临若干挑战,包括选择最优的姿态表示、在不增加额外参数的情况下整合姿态,以及在姿态保持与灵活姿态控制之间取得平衡。在本工作中,我们基于一个基线VTON模型进行构建,该模型在不使用外部编码器、控制网络或复杂注意力层的情况下拼接参考图像条件。我们研究了通过空间拼接姿态数据将姿态控制纳入此纯拼接范式的方法,比较了使用姿态图和骨架的性能,且未向基线模型添加任何额外参数或模块。我们的实验表明,使用姿态图的姿态拼接产生了最佳结果,增强了姿态保持和输出真实感。此外,我们引入了一种使用细粒度掩码和边界框掩码的混合掩码训练策略,使模型能够在不同姿态和条件下支持灵活的产品集成。
引用
@article{arxiv.2509.20343,
title = {Efficient Encoder-Free Pose Conditioning and Pose Control for Virtual Try-On},
author = {Qi Li and Shuwen Qiu and Julien Han and Xingzi Xu and Mehmet Saygin Seyfioglu and Kee Kiat Koo and Karim Bouyarmane},
journal= {arXiv preprint arXiv:2509.20343},
year = {2025}
}
备注
Submitted to CVPR 2025 and Published at CVPR 2025 AI for Content Creation workshop