中文

基于扩散模型的人脸交换

计算机视觉与模式识别 2024-05-30 v2

摘要

本技术报告提出了一种基于扩散模型的框架,用于两张人像图像之间的人脸交换。基础框架由三个组件组成,即 IP-Adapter、ControlNet 和 Stable Diffusion 的图像修复(inpainting)流水线,分别用于人脸特征编码、多条件生成和人脸修复。此外,我引入了面部引导优化和基于 CodeFormer 的融合以进一步提高生成质量。具体而言,我们采用了一种最近的轻量级定制方法(即 DreamBooth-LoRA),通过以下方式保证身份一致性:1)使用稀有标识符“sks”表示源身份;2)将源人像的图像特征像文本特征一样注入每个交叉注意力层。然后我借助 Stable Diffusion 强大的修复能力,并利用目标人像的 canny 图像和人脸检测标注作为条件,引导 ControlNet 的生成并使源人像与目标人像对齐。为了进一步校正人脸对齐,我们在样本生成过程中加入面部引导损失以优化文本嵌入。代码获取地址:https://github.com/somuchtome/Faceswap

关键词

引用

@article{arxiv.2403.01108,
  title  = {Face Swap via Diffusion Model},
  author = {Feifei Wang},
  journal= {arXiv preprint arXiv:2403.01108},
  year   = {2024}
}