Face2Diffusion:快速且可编辑的人脸个性化
计算机视觉与模式识别
2024-03-11 v1
摘要
人脸个性化旨在将从图像中提取的特定人脸插入到预训练的文本到图像扩散模型中。然而,由于对训练样本的过拟合,以往的方法在保持身份相似性和可编辑性方面仍具有挑战性。在本文中,我们提出了 Face2Diffusion (F2D) 以实现高可编辑性的人脸个性化。F2D 的核心思想是从训练流程中移除与身份无关的信息,以防止过拟合并提高编码人脸的可编辑性。F2D 包含以下三个新颖组件:1) 多尺度身份编码器在保持多尺度信息优势的同时提供良好解耦的身份特征,从而提高了相机姿态的多样性。2) 表情引导将人脸表情与身份解耦,并提高了人脸表情的可控性。3) 类引导去噪正则化鼓励模型学习人脸应如何去噪,从而提升了背景与文本的对齐度。在 FaceForensics++ 数据集和多样化提示词上的大量实验表明,与之前的最先进 (SOTA) 方法相比,我们的方法极大地改善了身份保真度与文本保真度之间的权衡。
引用
@article{arxiv.2403.05094,
title = {Face2Diffusion for Fast and Editable Face Personalization},
author = {Kaede Shiohara and Toshihiko Yamasaki},
journal= {arXiv preprint arXiv:2403.05094},
year = {2024}
}
备注
CVPR2024. Code: https://github.com/mapooon/Face2Diffusion, Webpage: https://mapooon.github.io/Face2DiffusionPage/