中文

DRDM:用于合成真实人物图像的解缠表示扩散模型

计算机视觉与模式识别 2024-12-30 v1

摘要

人物图像合成在可控人体姿态和外观的情况下是一项关键任务,因为在虚拟试穿、图像编辑和视频制作等实际场景中都有重要需求。然而,现有方法在细节缺失、肢体变形和服装风格偏差方面面临重大挑战。为此,我们提出一种解缠表示扩散模型 (DRDM),用于从源人像生成特定期望姿态和外观的照片级图像。首先,姿态编码器负责将姿态特征编码到高维空间以指导人物图像生成。其次,身体部位子空间解耦模块 (BSDB) 将来自源图不同身体部位的特征解耦,并输入到噪声预测块的不同层,从而为生成逼真的目标图像提供丰富的解缠特征。此外,在推理阶段,我们开发了基于解析图的解缠 classifier-free 引导采样方法,放大纹理和姿态的条件信号。在 Deepfashion 数据集上的大量实验表明,我们方法在实现姿态迁移和外观控制方面具有有效性。

关键词

引用

@article{arxiv.2412.18797,
  title  = {DRDM: A Disentangled Representations Diffusion Model for Synthesizing Realistic Person Images},
  author = {Enbo Huang and Yuan Zhang and Faliang Huang and Guangyu Zhang and Yang Liu},
  journal= {arXiv preprint arXiv:2412.18797},
  year   = {2024}
}