StableIdentity:首次呈现即可将任何人插入任何场景
计算机视觉与模式识别
2024-01-30 v1
摘要
大规模预训练文本到图像模型的最新进展展现了高质量以人为中心的生成的空前能力,然而,定制面部身份仍然是一个棘手的问题。现有方法无法确保稳定的身份保持性和灵活的可编辑性,即使在训练期间为每个主体提供多张图像也是如此。在这项工作中,我们提出了 StableIdentity,它仅用一张人脸图像即可实现身份一致的重置上下文。更具体地说,我们采用带有身份先验的人脸编码器对输入人脸进行编码,然后将人脸表示落入一个具有可编辑先验的空间中,该空间由名人姓名构建。通过结合身份先验和可编辑性先验,学习到的身份可以带有各种上下文地被注入任何地方。此外,我们设计了一种掩码两阶段扩散损失,以提升输入人脸的像素级感知并保持生成的多样性。大量实验表明我们的方法优于先前的定制方法。此外,学习到的身份可以与现成模块(如 ControlNet)灵活结合。值得注意的是,据我们所知,我们是第一个将单张图像学习到的身份直接注入视频/3D 生成而无需微调的。我们相信所提出的 StableIdentity 是统一图像、视频和 3D 定制生成模型的重要一步。
引用
@article{arxiv.2401.15975,
title = {StableIdentity: Inserting Anybody into Anywhere at First Sight},
author = {Qinghe Wang and Xu Jia and Xiaomin Li and Taiqing Li and Liqian Ma and Yunzhi Zhuge and Huchuan Lu},
journal= {arXiv preprint arXiv:2401.15975},
year = {2024}
}