InstantID:秒级零样本身份保持生成
计算机视觉与模式识别
2024-02-05 v2 人工智能
摘要
个性化图像合成已通过 Textual Inversion、DreamBooth 和 LoRA 等方法取得显著进展。然而,其实际应用受到高存储需求、冗长微调过程以及需要多张参考图像的限制。相反,现有的基于 ID 嵌入的方法虽然仅需单次前向推理,却面临挑战:它们要么需要对大量模型参数进行广泛微调,要么缺乏与社区预训练模型的兼容性,要么无法保持高面部保真度。为解决这些局限,我们提出 InstantID,一种基于扩散模型的强大解决方案。我们的即插即用模块仅使用单张面部图像即可熟练处理多种风格的图像个性化,同时确保高保真度。为此,我们设计了一种新颖的 IdentityNet,通过施加强语义和弱空间条件,将面部和关键点图像与文本提示相结合来引导图像生成。InstantID 展现出卓越的性能和效率,在身份保持至关重要的现实应用中极具价值。此外,我们的工作可与流行的预训练文本到图像扩散模型(如 SD1.5 和 SDXL)无缝集成,作为适应性插件。我们的代码和预训练检查点将在 https://github.com/InstantID/InstantID 上提供。
引用
@article{arxiv.2401.07519,
title = {InstantID: Zero-shot Identity-Preserving Generation in Seconds},
author = {Qixun Wang and Xu Bai and Haofan Wang and Zekui Qin and Anthony Chen and Huaxia Li and Xu Tang and Yao Hu},
journal= {arXiv preprint arXiv:2401.07519},
year = {2024}
}
备注
Technical Report, project page available at https://instantid.github.io/