Purposer:将人体运动生成置于场景上下文中
计算机视觉与模式识别
2024-04-22 v1
摘要
我们提出了一种生成人体运动以填充 3D 室内场景的新方法。该方法可以通过各种条件信号的组合进行控制,例如场景中的路径、目标姿态、过去的运动以及表示为 3D 点云的场景。现有 SOTA 方法要么是专用于单一设置的模型,需要大量高质量和多样化的训练数据,要么是不集成场景或其他上下文信息的无条件模型。因此,它们的适用性有限且依赖昂贵的训练数据。为了解决这些局限性,我们提出了一种基于神经离散表示学习的新方法,名为 Purposer。我们的模型能够以灵活的方式利用开放获取的大规模数据集(如 AMASS)中已有的不同类型的信息。首先,我们将无条件人体运动编码到离散潜在空间中。其次,一个以关键上下文信息为条件的自回归生成模型(通过提示或加法 token 进行条件化),并在该空间中训练用于下一步预测,合成潜在索引序列。我们进一步设计了一个新颖的条件化模块,通过使用具有两个分支的网络来计算独立的特征堆栈,从而在这种因果模型中处理未来的条件化信息。通过这种方式,Purposer 能够在多样化的测试场景中生成逼真的运动序列。通过详尽的评估,我们证明了我们的多上下文解决方案在质量和多样性方面均优于针对特定上下文信息的现有专用方法。我们的模型使用短序列进行训练,但能够使用各种条件化信号的一个副产品是,在测试时可以使用不同的组合将短序列链接在一起,并在上下文场景中生成长运动。
引用
@article{arxiv.2404.12942,
title = {Purposer: Putting Human Motion Generation in Context},
author = {Nicolas Ugrinovic and Thomas Lucas and Fabien Baradel and Philippe Weinzaepfel and Gregory Rogez and Francesc Moreno-Noguer},
journal= {arXiv preprint arXiv:2404.12942},
year = {2024}
}