PoseGPT:基于量化的3D人体运动生成与预测
计算机视觉与模式识别
2022-10-20 v1
摘要
我们研究动作条件下的生成人体运动序列问题。现有工作分为两类:基于观测过去运动的预测模型,或仅基于动作标签与时长条件的生成模型。相比之下,我们生成以任意长度(包括零长度)观测为条件的运动。为解决这一广义问题,我们提出PoseGPT,一种自回归的基于Transformer的方法,其在内部将人体运动压缩为量化的潜序列。自编码器首先将人体运动映射到离散空间中的潜索引序列,反之亦然。受生成式预训练Transformer(GPT)启发,我们提出在该空间中训练一个类GPT模型用于下一索引预测;这使得PoseGPT能够在有或无过去运动条件下输出可能未来的分布。潜空间的离散与压缩特性使类GPT模型可聚焦于长程信号,因其消除了输入信号中的底层冗余。预测离散索引也缓解了预测平均姿态这一常见陷阱——回归连续值时的典型失败情形,因为离散目标的平均值本身并非目标。实验结果表明,我们提出的方法在HumanAct12(一个标准但小规模的数据集)、BABEL(近期大规模动作捕捉数据集)以及GRAB(人-物交互数据集)上均取得了最先进(SOTA)结果。
引用
@article{arxiv.2210.10542,
title = {PoseGPT: Quantization-based 3D Human Motion Generation and Forecasting},
author = {Thomas Lucas and Fabien Baradel and Philippe Weinzaepfel and Grégory Rogez},
journal= {arXiv preprint arXiv:2210.10542},
year = {2022}
}
备注
ECCV'22 Conference paper