中文

PMMD:基于姿态引导的多视角多模态扩散人物生成

计算机视觉与模式识别 2025-12-18 v1 人工智能

摘要

生成具有可控姿态和外观的一致人物图像对于虚拟试穿、图像编辑和数字人创建等应用至关重要。当前方法常常受到遮挡、服装风格漂移和姿态错位的困扰。我们提出姿态引导的多视角多模态扩散(PMMD),一种条件于多视角参考、姿态图和文本提示,合成写实人物图像的扩散框架。多模态编码器联合建模视觉视角、姿态特征和语义描述,减少跨模态差异并提高身份保真度。我们进一步设计ResCVA模块以增强局部细节同时保持全局结构,并开发跨模态融合模块在去噪过程中将图像语义与文本整合。在DeepFashion多模态数据集上的实验表明,PMMD在一致性、细节保留和可控性方面均优于代表性基线。项目页面和代码均可在https://github.com/ZANMANGLOOPYE/PMMD获取。

关键词

引用

@article{arxiv.2512.15069,
  title  = {PMMD: A pose-guided multi-view multi-modal diffusion for person generation},
  author = {Ziyu Shang and Haoran Liu and Rongchao Zhang and Zhiqian Wei and Tongtong Feng},
  journal= {arXiv preprint arXiv:2512.15069},
  year   = {2025}
}