中文

UPGPT:面向人物图像生成、编辑与姿态迁移的通用扩散模型

计算机视觉与模式识别 2023-12-19 v2 人工智能

摘要

文本到图像模型(T2I)如 StableDiffusion 已被用于生成高质量人物图像。然而,由于生成过程的随机性,尽管使用相同文本提示,人物外观(如姿态、面部和衣着)各不相同。这种外观不一致使 T2I 不适用于姿态迁移。为此,我们提出一种接受文本、姿态和视觉提示的多模态扩散模型。我们的模型是首个统一执行所有人物图像任务——生成、姿态迁移和无掩码编辑——的方法。我们还开创性直接使用小维度 3D 身体模型参数,展示了新能力——在保持人物外观的同时进行姿态与相机视角的同步插值。

关键词

引用

@article{arxiv.2304.08870,
  title  = {UPGPT: Universal Diffusion Model for Person Image Generation, Editing and Pose Transfer},
  author = {Soon Yau Cheong and Armin Mustafa and Andrew Gilbert},
  journal= {arXiv preprint arXiv:2304.08870},
  year   = {2023}
}