中文

DiffBody:基于扩散模型的人体图像姿态与形状编辑

计算机视觉与模式识别 2024-01-09 v2 图形学

摘要

人体图像中的姿态与身体形状编辑日益受到关注。然而,现有方法往往受限于数据集偏差,且在用户进行大幅编辑时会导致真实感下降及人物身份特征丢失。我们提出了一种单次拍摄(one-shot)方法,能够在保持身份特征的同时实现大幅编辑。为实现大幅编辑,我们拟合一个三维人体模型,将输入图像投影到该三维模型上,并改变身体的姿态与形状。由于初始纹理化人体模型因遮挡和身体形状不准确而存在伪影,渲染后的图像需经过基于扩散的细化处理;在此过程中,过强的噪声会破坏身体结构和身份特征,而不足的噪声则无法起到改善作用。因此,我们提出了一种弱噪声迭代细化策略,首先应用于全身,随后应用于面部。此外,我们通过自监督学习微调文本嵌入以进一步增强真实感。定量与定性评估表明,我们的方法在多个数据集上均优于现有其他方法。

关键词

引用

@article{arxiv.2401.02804,
  title  = {DiffBody: Diffusion-based Pose and Shape Editing of Human Images},
  author = {Yuta Okuyama and Yuki Endo and Yoshihiro Kanamori},
  journal= {arXiv preprint arXiv:2401.02804},
  year   = {2024}
}

备注

Accepted to WACV 2024, project page: https://www.cgg.cs.tsukuba.ac.jp/~okuyama/pub/diffbody/