中文

DH-VTON:基于混合注意力学习的深层文本驱动虚拟试穿

计算机视觉与模式识别 2024-10-17 v1 人工智能

摘要

虚拟试穿(VTON)旨在合成特定人物图像的服装,这近年来在线上购物场景中受到广泛关注。当前,VTON 任务的核心挑战主要在于在深度估计和服装合成/扭曲到人体上时,对给定参考服装的细粒度语义提取(即深层语义)以及有效的纹理保持。为应对这些问题,我们提出了 DH-VTON,一种基于特殊混合注意力学习策略和深层服装语义保持模块的深度文本驱动虚拟试穿模型。我们立足于一个 well-built 的预训练绘画-by-example(简称 PBE)方法,提出了本文中的 DH-VTON 管道。具体而言,为提取服装的深层语义,我们首先引入InternViT-6B作为细粒度特征学习器,可以训练来与大规模内在知识对齐,如“领口”或“腰带”等深层文本语义,以弥补常用 CLIP 编码器的不足。基于此,为增强定制化穿衣能力,我们进一步引入 Garment-Feature ControlNet Plus(简称 GFC+)模块,并提出利用一种新颖的混合注意力策略进行训练,该策略可以自适应地将服装的细粒度特征整合到 VTON 模型的不同层中,以实现多尺度特征保持效果。在几个代表性数据集上的大量实验表明,我们的方法优于以前的基于扩散和基于生成对抗网络的方法,在保持服装细节和生成真实人体图像方面表现具有竞争力。

关键词

引用

@article{arxiv.2410.12501,
  title  = {DH-VTON: Deep Text-Driven Virtual Try-On via Hybrid Attention Learning},
  author = {Jiabao Wei and Zhiyuan Ma},
  journal= {arXiv preprint arXiv:2410.12501},
  year   = {2024}
}

备注

5 pages, 6 figures, ICASSP2025