高保真以人物为中心的主体到图像生成
计算机视觉与模式识别
2024-05-06 v5 人工智能
摘要
当前的主体驱动图像生成方法在以人物为中心的图像生成中遇到重大挑战。原因在于它们通过微调一个通用的预训练扩散模型来学习语义场景与人物生成,这涉及不可调和的训练失衡。具体而言,为生成逼真的人物,它们需要充分微调预训练模型,而这不可避免地导致模型遗忘丰富的语义场景先验,并使场景生成过拟合到训练数据。此外,即便充分微调,这些方法仍无法生成高保真人物,因为场景与人物生成的联合学习也会导致质量折损。本文提出 Face-diffuser,一种有效的协同生成流水线,以消除上述训练失衡与质量折损。具体地,我们首先开发两个专门的预训练扩散模型,即文本驱动扩散模型(Text-driven Diffusion Model, TDM)与主体增强扩散模型(Subject-augmented Diffusion Model, SDM),分别用于场景与人物生成。采样过程分为三个顺序阶段:语义场景构建、主体-场景融合与主体增强。第一与最后阶段分别由 TDM 与 SDM 执行。主体-场景融合阶段即通过一种新颖且高效的机制——显著性自适应噪声融合(Saliency-adaptive Noise Fusion, SNF)实现的协同。具体而言,其基于我们的关键观察:在无分类器引导(classifier-free guidance)响应与生成图像的显著性之间存在稳健关联。在每时间步,SNF 利用各模型的独特优势,并以显著性感知的方式自动实现两模型预测噪声的空间混合。大量实验证实了 Face-diffuser 令人印象深刻的效力与鲁棒性。
引用
@article{arxiv.2311.10329,
title = {High-fidelity Person-centric Subject-to-Image Synthesis},
author = {Yibin Wang and Weizhong Zhang and Jianwei Zheng and Cheng Jin},
journal= {arXiv preprint arXiv:2311.10329},
year = {2024}
}
备注
Accepted by CVPR2024. Code: https://github.com/CodeGoat24/Face-diffuser