CapHuman:在平行宇宙中捕捉你的瞬间
计算机视觉与模式识别
2024-05-20 v3 人工智能
摘要
我们专注于一项新颖的以人为中心的图像合成任务,即仅给定一张参考面部照片,期望生成具有不同头部位置、姿态、面部表情和光照的特定个体图像,且背景各异。为实现这一目标,我们认为我们的生成模型应具备以下有利特性:(1)对世界和人类社会的强大视觉和语义理解,以生成基本物体和人物图像;(2)可泛化的身份保持能力;(3)灵活且细粒度的头部控制。最近,大型预训练文本到图像扩散模型已展现出显著成果,成为强大的生成基础。在此基础上,我们旨在释放预训练模型的上述两种能力。在本工作中,我们提出了一个名为CapHuman的新框架。我们采用“编码然后学习对齐”范式,使得新个体无需在推理时进行繁琐的调优即可实现可泛化的身份保持。CapHuman编码身份特征,然后学习将其对齐到潜在空间。此外,我们引入3D面部先验,使我们的模型能够以灵活且3D一致的方式控制头部。广泛的定性和定量分析表明,我们的CapHuman能够生成身份保持良好、照片级真实且高保真的肖像,具有丰富的内容表示和多样的头部渲染,优于已建立的基线。代码和检查点将在https://github.com/VamosC/CapHuman发布。
引用
@article{arxiv.2402.00627,
title = {CapHuman: Capture Your Moments in Parallel Universes},
author = {Chao Liang and Fan Ma and Linchao Zhu and Yingying Deng and Yi Yang},
journal= {arXiv preprint arXiv:2402.00627},
year = {2024}
}
备注
Accepted by CVPR 2024. Project page: https://caphuman.github.io/