中文

基于并行视觉注意力的扩散模型个性化人脸修复

计算机视觉与模式识别 2023-12-07 v1 机器学习

摘要

人脸修复在照片修复、图像编辑和虚拟现实等多种应用中非常重要。尽管人脸生成模型取得了显著进展,但在修复过程中确保保持个人独特的面部身份仍然是一个难以实现的目标。以 MyStyle 为代表的当前最先进技术需要为每个新身份进行资源密集型的微调并使用大量图像。此外,现有方法通常无法满足用户指定的语义属性(如胡须或表情)。为了改善修复结果并降低推理过程中的计算复杂度,本文提出在扩散模型中使用并行视觉注意力。具体而言,我们在去噪网络的每个交叉注意力模块中插入并行注意力矩阵,以关注由身份编码器从参考图像中提取的特征。我们在 CelebAHQ-IDI(一个为保持身份的人脸修复提出的数据集)上训练添加的注意力模块和身份编码器。实验表明,与包括 MyStyle、Paint by Example 和 Custom Diffusion 在内的各种基准相比,PVA 在人脸修复和带语言引导的人脸修复任务中均获得了无与伦比的身份相似度。我们的研究结果表明,PVA 在确保良好身份保持的同时,提供了有效的语言可控性。此外,与 Custom Diffusion 相比,PVA 对每个新身份仅需 40 步微调,这意味着速度显著提升超过 20 倍。

关键词

引用

@article{arxiv.2312.03556,
  title  = {Personalized Face Inpainting with Diffusion Models by Parallel Visual Attention},
  author = {Jianjin Xu and Saman Motamed and Praneetha Vaddamanu and Chen Henry Wu and Christian Haene and Jean-Charles Bazin and Fernando de la Torre},
  journal= {arXiv preprint arXiv:2312.03556},
  year   = {2023}
}