中文

多模态服装设计器:用于时尚图像编辑的以人为中心的隐扩散模型

计算机视觉与模式识别 2023-08-24 v2 人工智能 多媒体

摘要

时装插画被设计师用来传达他们的愿景,并将设计理念从概念化带到实现,展示服装如何与人体互动。在此背景下,计算机视觉可用于改进时装设计过程。与之前主要关注服装虚拟试穿的工作不同,我们提出了多模态条件时尚图像编辑任务,通过遵循多模态提示(如文本、人体姿态和服装草图)来引导以人为中心的时尚图像生成。我们通过提出一种基于隐扩散模型的新架构来解决此问题,这种方法此前未在时尚领域使用过。鉴于缺乏适用于该任务的现有数据集,我们还以半自动方式收集多模态标注,扩展了两个现有时尚数据集,即Dress Code和VITON-HD。在这些新数据集上的实验结果证明了我们的方案在真实感以及与给定多模态输入的一致性方面的有效性。源代码和收集的多模态标注公开于:https://github.com/aimagelab/multimodal-garment-designer。

关键词

引用

@article{arxiv.2304.02051,
  title  = {Multimodal Garment Designer: Human-Centric Latent Diffusion Models for Fashion Image Editing},
  author = {Alberto Baldrati and Davide Morelli and Giuseppe Cartella and Marcella Cornia and Marco Bertini and Rita Cucchiara},
  journal= {arXiv preprint arXiv:2304.02051},
  year   = {2023}
}

备注

ICCV 2023