SPG-VTON:面向多姿态虚拟试穿的语义预测引导网络
计算机视觉与模式识别
2022-10-18 v2
摘要
基于图像的虚拟试穿在将目标店内服装适配到不同人体姿态下的参考人物时具有挑战性。以往的工作侧重于在固定姿态下将所需服装转移到目标人物时保留服装细节(如纹理、标志、图案)。然而,当将现有方法扩展到多姿态虚拟试穿时,其性能显著下降。本文提出了一种端到端的语义预测引导多姿态虚拟试穿网络(SPG-VTON),该网络能够将所需服装适配到任意姿态下的参考人物。具体而言,SPG-VTON由三个子模块组成。首先,语义预测模块(SPM)生成所需的语义图。预测的语义图提供了更丰富的引导,以定位所需服装区域并生成粗略的试穿图像。其次,服装变形模块(CWM)根据预测的语义图和所需姿态将店内服装变形为所需形状。特别地,我们引入了一种可引导的循环一致性损失,以缓解服装变形过程中的错位问题。第三,试穿合成模块(TSM)结合粗略结果和变形后的服装,生成最终的虚拟试穿图像,在所需姿态下保留所需服装的细节。此外,我们引入了人脸身份损失,以细化面部外观并同时保持最终虚拟试穿结果的身份。我们在最大的多姿态数据集(MPV)和DeepFashion数据集上评估了所提方法。定性和定量实验表明,SPG-VTON优于最先进的方法,并且对数据噪声(包括背景和配饰变化,如帽子和手提包)具有鲁棒性,显示出对真实世界场景的良好可扩展性。
引用
@article{arxiv.2108.01578,
title = {SPG-VTON: Semantic Prediction Guidance for Multi-pose Virtual Try-on},
author = {Bingwen Hu and Ping Liu and Zhedong Zheng and Mingwu Ren},
journal= {arXiv preprint arXiv:2108.01578},
year = {2022}
}