中文

TruePose:基于人类解析引导的注意力扩散用于全身份保留姿态转换

计算机视觉与模式识别 2025-02-06 v1 人工智能

摘要

姿态引导的人物图像合成(Pose-Guided Person Image Synthesis, PGPIS)生成的图像需保持来自源图像的主体身份,并采用指定的目标姿态(例如,骨架)。虽然扩散基方法在姿态转换期间有效地保留面部特征,但往往难以准确地在扩散过程中保持来自源图像的服装细节。当源姿态与目标姿态之间存在显著差异时,这一限制在时尚行业尤为突出,因为服装风格的保存对版权保护至关重要。我们的分析表明,这一限制主要源自条件扩散模型的注意力模块未能充分捕捉和保留服装图案。为此,我们提出了人类解析引导的注意力扩散方法,有效地在生成高质量结果的同时保留面部和服装外观。我们提出了一种人类解析感知的双身网络,包含三个关键组件:双 Identical UNet(TargetNet用于扩散去噪,SourceNet用于源图像嵌入提取)、人类解析引导融合注意力(Human-Parsing-Guided Fusion Attention, HPFA),以及CLIP引导的注意力对齐(CLIP-Guided Attention Alignment, CAA)。HPFA和CAA模块能够适应性地高效地将面部和服装图案嵌入目标图像生成中。在时尚服装检索基准数据集和最新野外人类编辑数据集上的大量实验表明,我们的方法在保留源图像中面部和服装外观方面优于13个基线方法。

关键词

引用

@article{arxiv.2502.03426,
  title  = {TruePose: Human-Parsing-guided Attention Diffusion for Full-ID Preserving Pose Transfer},
  author = {Zhihong Xu and Dongxia Wang and Peng Du and Yang Cao and Qing Guo},
  journal= {arXiv preprint arXiv:2502.03426},
  year   = {2025}
}