多模态姿态扩散器:一种多模态生成条件姿态先验
计算机视觉与模式识别
2024-10-21 v1
摘要
Skinned Multi-Person Linear (SMPL) 模型在3D人体姿态估计中发挥着关键作用,提供了人体姿态的简洁且有效的表征。然而,确保在诸如人体网格回归等任务中SMPL配置的有效性仍然是一个重大挑战,这凸显了需要一种能够辨别真实人体姿态的稳健人体姿态先验的必要性。为此,我们引入了MOPED:\underline{M}ulti-m\underline{O}dal \underline{P}os\underline{E} \underline{D}iffuser。MOPED是首个利用新颖的多模态条件扩散模型作为SMPL姿态参数先验的方法。我们的方法提供了强大的无条件姿态生成能力,能够对诸如图像和文本等的多模态输入进行条件化。这种能力通过整合传统姿态先验中常被忽视的额外上下文来增强其适用性。针对姿态估计、姿态去噪和姿态完成三个不同任务进行的大量实验表明,我们的多模态扩散模型基于先验的方法显著优于现有方法。这些结果表明我们的模型捕捉了更广泛的合理人体姿态范围。
引用
@article{arxiv.2410.14540,
title = {Multi-modal Pose Diffuser: A Multimodal Generative Conditional Pose Prior},
author = {Calvin-Khang Ta and Arindam Dutta and Rohit Kundu and Rohit Lal and Hannah Dela Cruz and Dripta S. Raychaudhuri and Amit Roy-Chowdhury},
journal= {arXiv preprint arXiv:2410.14540},
year = {2024}
}