中文

IMAGDressing-v1:可定制的虚拟穿搭

计算机视觉与模式识别 2024-08-07 v2

摘要

最新进展通过基于潜在扩散模型的局部衣物插图实现了逼真的虚拟试穿(VTON),显著提升了消费者的线上购物体验。然而,现有VTON技术忽略了商家综合展示衣物的需求,包括对衣物、可选面部、姿势和场景的灵活控制。为此,我们定义了虚拟穿搭(VD)任务,聚焦于生成带有固定衣物和可选条件的可编辑人类图像。同时,我们设计了综合亲和力指数(CAMI)来评估生成图像与参考衣物之间的一致性。我们提出IMAGDressing-v1, incorporates garment UNet从CLIP获取语义特征从VAE获取纹理特征。我们提出了混合注意力模块,包括冻结自注意力和可训练交叉注意力,以将来自衣物UNet的特征整合到冻结去噪UNet中,确保用户可以通过文本控制不同场景。IMAGDressing-v1可以与其他扩展插件如ControlNet和IP-Adapter结合,以增强生成图像的多样性和可控性。此外,为解决数据不足问题,我们发布了交互式衣物搭配(IGPair)数据集,包含30万多对衣物和穿戴图像,并建立了标准的数据装配管道。广泛的实验表明,IMAGDressing-v1在各种受控条件下实现了最先进的人类图像合成性能。代码和模型将在https://github.com/muzishen/IMAGDressing上提供。

关键词

引用

@article{arxiv.2407.12705,
  title  = {IMAGDressing-v1: Customizable Virtual Dressing},
  author = {Fei Shen and Xin Jiang and Xin He and Hu Ye and Cong Wang and Xiaoyu Du and Zechao Li and Jinhui Tang},
  journal= {arXiv preprint arXiv:2407.12705},
  year   = {2024}
}