基于风场感知基础设施的人员图像合成中的跨视图掩码扩散变换器
计算机视觉与模式识别
2024-06-04 v2
摘要
我们提出X-MDPT(\underline{Cross}-view \underline{M}asked \underline{D}iffusion \underline{P}rediction \underline{T}ransformers),一种用于姿态引导的人类图像生成的新型扩散模型。X-MDPT 区别于现有工作中常用的Unet结构,采用在潜在块上 operate 的掩码扩散变换器。该模型包含三个关键模块:1)去噪扩散变换器,2)聚合网络将条件统一整合为单个向量用于扩散过程,3)掩码跨预测模块通过参考图像的语义信息增强表示学习。X-MDPT 在大型模型方面表现出可扩展性,FID、SSIM 和 LPIPS 指标均有所提高。尽管设计简单,本模型在DeepFashion 数据集上超越了最先进的方法,同时在训练参数、训练时间和推理速度方面表现出高效。我们的紧凑型33MB模型实现了7.42的FID,仅使用更少的参数就超过了先前的Unet 潜在扩散方法(FID 8.07)。我们的最佳模型在参数数量上仅为,实现了更快的推理速度。代码可在 https://github.com/trungpx/xmdpt 获取。
关键词
引用
@article{arxiv.2402.01516,
title = {Cross-view Masked Diffusion Transformers for Person Image Synthesis},
author = {Trung X. Pham and Zhang Kang and Chang D. Yoo},
journal= {arXiv preprint arXiv:2402.01516},
year = {2024}
}
备注
ICML 2024