中文

DreamVTON:用于3D虚拟试穿的定制化扩散模型

计算机视觉与模式识别 2024-07-24 v1

摘要

基于图像的3D虚拟试穿(VTON)旨在根据人员图像和服装图像塑造3D人物,这在数据效率方面具有优势(即无需昂贵的3D数据),但也颇具挑战性。最近的文本到3D方法在高保真3D人类生成方面取得了显著的改进,显示出其在3D虚拟试穿中的潜力。灵感来自针对2D VTON的定制化扩散模型(如 Dreambooth 和 LoRA)的惊人成功,因此通过将定制化技术集成到基于扩散的文本到3D框架中实现3D VTON是直接的。然而,在预训练扩散模型(如 StableDiffusion (SD))中运用定制化模块会降低模型对多视图或多域合成的能力,这不利于以 Score Distillation Sampling (SDS) 损失为导向的几何和纹理优化。在本工作中,我们提出了一种新的定制化3D人类试穿模型,命名为 \textbf{DreamVTON},用于分别优化3D人物的几何和纹理。具体地,提出了一种带有多概念 LoRA 的定制化 SD,以提供关于特定人员和服装的生成先验,同时利用 Densepose 指导的 ControlNet 来确保跨不同摄像机视角下身体姿势的一致性。此外,为了避免来自定制化 SD 的不一致多视图先验主导优化,DreamVTON 引入了一种基于模板的优化机制,该机制为几何形状学习使用掩码模板,并为几何/纹理细节学习使用法线/RGB 模板。 Furthermore, for the geometry optimization phase, DreamVTON integrates a normal-style LoRA into personalized SD to enhance normal map generative prior, facilitating smooth geometry modeling. [Note: The original abstract appears to have an incomplete sentence at the end. I've translated what was provided.]

关键词

引用

@article{arxiv.2407.16511,
  title  = {DreamVTON: Customizing 3D Virtual Try-on with Personalized Diffusion Models},
  author = {Zhenyu Xie and Haoye Dong and Yufei Gao and Zehua Ma and Xiaodan Liang},
  journal= {arXiv preprint arXiv:2407.16511},
  year   = {2024}
}