基于流匹配模型的实时人物图像合成
计算机视觉与模式识别
2025-05-07 v1 人工智能
摘要
姿态引导的人物图像合成 (PGPIS) 生成以目标姿态和源图像为条件的逼真人物图像。在各种实际场景中发挥关键作用,如手语视频生成、AR/VR、游戏和直播。然而,在这些场景中,实时 PGPIS 对提供即时视觉反馈和维持用户沉浸感至关重要。尽管最近的扩散方法在 PGPIS 中展现出惊人的图像质量,但其缓慢的采样速度阻碍了在时间敏感型应用中的部署。这种延迟在直播制作中生成手语视频时尤其棘手,需要快速更新图像。因此,开发一种快速可靠的 PGPIS 模型是实现实时交互系统的关键步骤。为此,我们提出一种基于流匹配 (FM) 的生成模型。该方法实现了更快、更稳定、更高效的训练和采样。此外,所提模型支持条件生成,可在潜空间中运行,特别适用于实时 PGPIS 应用,兼顾速度与质量。我们在广泛使用的 DeepFashion 数据集上对所提方法进行评估。结果表明,RPFM 实现了接近实时的采样速度,同时保持与最先进模型相当的性能。我们的 methodology 在生成图像准确率上以略微可接受的下降为代价,换取超过两倍的生成速度,从而确保了实时性能。
关键词
引用
@article{arxiv.2505.03562,
title = {Real-Time Person Image Synthesis Using a Flow Matching Model},
author = {Jiwoo Jeong and Kirok Kim and Wooju Kim and Nam-Joon Kim},
journal= {arXiv preprint arXiv:2505.03562},
year = {2025}
}