中文

基于去噪扩散模型的人体图像合成

计算机视觉与模式识别 2023-03-02 v2

摘要

姿态引导的人体图像生成任务要求合成任意姿态下的照片级真实人体图像。现有方法使用生成对抗网络,不一定能保持真实纹理,或需要稠密对应,难以处理复杂形变与严重遮挡。本工作中,我们展示去噪扩散模型如何应用于高保真人体图像合成,具备强样本多样性与所学数据分布的增强模式覆盖。我们提出的 Person Image Diffusion Model (PIDM) 将复杂的迁移问题拆解为一系列更简单的正向-反向去噪步骤。这有助于学习合理的源到目标变换轨迹,从而产生保真纹理与无失真外观细节。我们引入基于交叉注意力的“纹理扩散模块”以准确建模源与目标图像中外观与姿态信息间的对应。进一步,我们提出“解耦无分类器引导”以确保条件输入与合成输出在姿态与外观信息上均高度相似。我们在两个大规模基准与一项用户研究上的广泛结果表明,在挑战性场景下我们方法具照片级真实感。我们也展示所生成图像如何助力下游任务。我们的代码与模型将公开发布。

关键词

引用

@article{arxiv.2211.12500,
  title  = {Person Image Synthesis via Denoising Diffusion Model},
  author = {Ankan Kumar Bhunia and Salman Khan and Hisham Cholakkal and Rao Muhammad Anwer and Jorma Laaksonen and Mubarak Shah and Fahad Shahbaz Khan},
  journal= {arXiv preprint arXiv:2211.12500},
  year   = {2023}
}

备注

Accepted to CVPR 2023