用于姿态引导人物图像合成的由粗到细潜在扩散模型
计算机视觉与模式识别
2024-04-10 v2
摘要
扩散模型是一种颇具前景的图像生成方法,已被应用于姿态引导人物图像合成(PGPIS)并取得了具有竞争力的性能。然而,现有方法仅将人物外观与目标姿态对齐,由于缺乏对源人物图像的高层语义理解,容易发生过拟合。本文提出了一种用于 PGPIS 的新型由粗到细潜在扩散(CFLD)方法。在缺乏图像 - caption 对和文本提示的情况下,我们开发了一种完全基于图像的新型训练范式,以控制预训练文本到图像扩散模型的生成过程。我们设计了一个感知细化解码器,用于逐步细化一组可学习查询,并提取人物图像的语义理解作为粗粒度提示。这使得细粒度外观和姿态信息控制在不同阶段得以解耦,从而规避了潜在的过拟合问题。为了生成更逼真的纹理细节,我们提出了一种混合粒度注意力模块,将多尺度细粒度外观特征编码为偏置项以增强粗粒度提示。在 DeepFashion 基准上的定量和定性实验结果均表明,我们的方法在 PGPIS 任务上优于现有技术。代码地址:https://github.com/YanzuoLu/CFLD。
引用
@article{arxiv.2402.18078,
title = {Coarse-to-Fine Latent Diffusion for Pose-Guided Person Image Synthesis},
author = {Yanzuo Lu and Manlin Zhang and Andy J Ma and Xiaohua Xie and Jian-Huang Lai},
journal= {arXiv preprint arXiv:2402.18078},
year = {2024}
}
备注
Accepted by CVPR 2024 (Highlight)