基于手部先验嵌入引导的虚拟试穿 VTON-HandFit
计算机视觉与模式识别
2024-08-28 v2
摘要
尽管扩散模型虚拟试穿已取得显著进展,但新兴方法仍难有效解决手部遮挡问题(即被手部部分遮盖的服装区域),导致试穿性能显著下降。为解决这一在现实场景中普遍存在的问题,我们提出 VTON-HandFit,利用手部先验重建手部遮挡案例的外观与结构。首先,我们使用基于 ControlNet 的结构设计一个手姿聚合网络(Handpose Aggregation Net),显式且自适应地编码全局手部和姿态先验。此外,为充分利用与手部相关的结构和外观信息,我们提出手部特征解耦嵌入模块(Hand-feature Disentanglement Embedding),将手部先验解耦为手部结构参数化特征和视觉外观特征,并定制掩码交叉注意力进行进一步的解耦特征嵌入。最后,我们定制手部-canny 约束损失,以更好地从模型图像的手部模板中学习结构边缘知识。VTON-HandFit 在公共数据集和我们自采集的手部遮挡 Handfit-3K 数据集上进行定性和定量评估,尤其在现实场景中任意手部姿态遮挡案例中表现优于基线方法。代码和数据集将在 \url{https://github.com/VTON-HandFit/VTON-HandFit} 公开。
引用
@article{arxiv.2408.12340,
title = {VTON-HandFit: Virtual Try-on for Arbitrary Hand Pose Guided by Hand Priors Embedding},
author = {Yujie Liang and Xiaobin Hu and Boyuan Jiang and Donghao Luo and Kai WU and Wenhui Han and Taisong Jin and Chengjie Wang},
journal= {arXiv preprint arXiv:2408.12340},
year = {2024}
}
备注
The project page is \url{https://vton-handfit.github.io}