中文

Fusion is all you need:用于定制化保持身份图像合成的面部融合

计算机视觉与模式识别 2024-10-03 v2

摘要

文本到图像(T2I)模型显著推动了人工智能的发展,能够根据特定文本提示在不同情境下生成高质量图像。然而,现有的基于 T2I 的方法往往难以从参考图像中准确再现个人外貌,并在各种场景中为这些个体创建新的表征。为了解决这一问题,我们利用 Stable Diffusion 中预训练的 UNet,将目标人脸图像直接纳入生成过程。我们的方法不同于以往依赖固定编码器或静态人脸嵌入的方法,这些方法通常无法弥合编码差距。相反,我们利用 UNet 先进的编码能力在多个尺度上处理参考图像。通过创新性地改变 UNet 的交叉注意力层,我们有效地将个体身份融合到生成过程中。这种跨多尺度的面部特征战略性整合,不仅增强了生成图像的鲁棒性和一致性,还促进了高效的多参考和多身份生成。我们的方法在保持身份的图像生成领域确立了新的基准,在相似度指标上提供了 SOTA 结果,同时保持了与提示的对齐。

关键词

引用

@article{arxiv.2409.19111,
  title  = {Fusion is all you need: Face Fusion for Customized Identity-Preserving Image Synthesis},
  author = {Salaheldin Mohamed and Dong Han and Yong Li},
  journal= {arXiv preprint arXiv:2409.19111},
  year   = {2024}
}