中文

Sketch2Human:基于解耦几何与外观控制的深度人类生成

计算机视觉与模式识别 2024-04-25 v1 图形学

摘要

几何与外观控制的完整人体图像生成是一个有趣但具有挑战性的任务。现有解决方案要么是无条件的,要么依赖粗糙条件(如姿态、文本),因此缺乏对身体和服装几何与外观的显式控制。素描提供了这种编辑能力,已被采纳于各种基于素描的人脸生成和编辑解决方案中。然而,直接将基于素描的人脸生成适用于完整人体生成往往难以产生高保真度和多样性的结果,因为姿态、身体形状和服装形状与纹理的复杂性和多样性。最近的基于几何可控扩散的方法主要依赖提示生成外观,难以在输入粗糙时平衡结果的真实性与对素描的忠实度。本工作提出了 Sketch2Human,即第一个受语义素描(用于几何控制)和参考图像(用于外观控制)引导的可控完整人体图像生成系统。我们的解决方案基于 StyleGAN-Human 的潜在空间,以解耦的几何和外观 latent code 为输入。具体而言,我们提出了一个从 StyleGAN-Human 潜在空间中抽样的大型合成数据集训练的素描编码器,直接由素描监督而非真实图像。鉴于 StyleGAN-Human 中部分几何和纹理信息的纠缠以及缺乏解耦数据集,我们设计了一种新型训练方案,以创建保持几何不变且实现外观迁移的训练数据,以调优生成器以实现解耦的几何和外观控制。尽管我们的模型使用合成数据训练,但它能够处理手绘素描。定性和定量评估表明,我们的方法在状态-of-the-art 方法方面表现卓越。

关键词

引用

@article{arxiv.2404.15889,
  title  = {Sketch2Human: Deep Human Generation with Disentangled Geometry and Appearance Control},
  author = {Linzi Qu and Jiaxiang Shang and Hui Ye and Xiaoguang Han and Hongbo Fu},
  journal= {arXiv preprint arXiv:2404.15889},
  year   = {2024}
}