迈向扩散模型中以人为中心先验的有效利用:用于基于文本的人像生成
计算机视觉与模式识别
2024-03-11 v1 人工智能
机器学习
摘要
普通的文本到图像扩散模型在生成准确的人像方面存在困难,常导致解剖结构不完美,如姿势不自然或肢体比例失调。现有方法大多通过在图像生成阶段使用额外图像微调模型或添加额外控制条件(如姿态或深度图等以人为中心的先验)来解决此问题。本文探索将这些以人为中心的先验直接整合到模型微调阶段,从而实质上消除了推理阶段对额外条件的需求。我们通过提出一种以人为中心的对齐损失来实现这一构想,以增强交叉注意力图中来自文本提示的人体相关信息。为确保微调过程中的语义细节丰富度和人体结构准确性,基于对交叉注意力层的深入分析,我们在扩散过程中引入了尺度感知和逐步约束。大量实验表明,我们的方法在基于用户编写提示合成高质量人像方面,大幅优于最先进的文本到图像模型。项目页面:\url{https://hcplayercvpr2024.github.io}。
引用
@article{arxiv.2403.05239,
title = {Towards Effective Usage of Human-Centric Priors in Diffusion Models for Text-based Human Image Generation},
author = {Junyan Wang and Zhenhong Sun and Zhiyu Tan and Xuanbai Chen and Weihua Chen and Hao Li and Cheng Zhang and Yang Song},
journal= {arXiv preprint arXiv:2403.05239},
year = {2024}
}
备注
Accepted to CVPR 2024