DivDiff:用于多样化人体运动预测的条件扩散模型
计算机视觉与模式识别
2024-09-04 v1 人工智能
摘要
多样化人体运动预测(HMP)旨在根据观测到的人体运动序列预测多种合理的未来运动。由于潜在人体运动具有多样性,同时需确保对未来人体运动的准确描述,这是一项具有挑战性的任务。当前的解决方案要么多样性较低,要么表达能力有限。最近的去噪扩散模型(DDPM)在生成任务中具备潜在的生成能力。然而,将 DDPM 直接引入多样化 HMP 会引发一些问题。尽管 DDPM 可以增加人体运动潜在模式的多样性,但由于 DDPM 前向过程中存在显著的噪声干扰,预测的人体运动会随时间推移变得不合理。这一现象导致预测的人体运动难以控制,严重影响预测运动的质量,并限制了其在实际场景中的适用性。为缓解此问题,我们提出了一种新颖的基于条件扩散的生成模型,称为 DivDiff,以预测更加多样且逼真的人体运动。具体而言,DivDiff 采用 DDPM 作为骨干网络,并结合离散余弦变换(DCT)和 Transformer 机制将观测到的人体运动序列编码为条件,以指导 DDPM 的逆向过程。更重要的是,我们设计了一种多样化强化采样函数(DRSF),以对预测的人体运动施加人体骨骼约束。DRSF 利用从人体骨骼获取的信息作为先验知识,从而减少前向过程中引入的显著干扰。在两个广泛使用的数据集(Human3.6M 和 HumanEva-I)上的大量实验结果表明,我们的模型在多样性和准确性方面均取得了具有竞争力的性能。
引用
@article{arxiv.2409.00014,
title = {DivDiff: A Conditional Diffusion Model for Diverse Human Motion Prediction},
author = {Hua Yu and Yaqing Hou and Wenbin Pei and Qiang Zhang},
journal= {arXiv preprint arXiv:2409.00014},
year = {2024}
}