MotionBERT:学习人体运动表征的统一视角
计算机视觉与模式识别
2023-08-15 v5
摘要
我们提出一种统一视角,通过从大规模异构数据资源中学习人体运动表征来处理各种以人为中心的视频任务。具体而言,我们提出一个预训练阶段,其中训练一个运动编码器从含噪的部分 2D 观测中恢复潜在的 3D 运动。以这种方式获得的运动表征融合了关于人体运动的几何、运动学与物理知识,可轻松迁移到多个下游任务。我们用双流时空 Transformer(DSTformer)神经网络实现该运动编码器。它能全面且自适应地捕捉骨骼关节间长程时空关系,在从头训练时以迄今最低的 3D 姿态估计误差为例证。此外,我们提出的框架仅通过用简单回归头(1-2 层)微调预训练运动编码器,就在全部三个下游任务上取得了 SOTA 性能,这证明了所学运动表征的通用性。代码与模型见 https://motionbert.github.io/
引用
@article{arxiv.2210.06551,
title = {MotionBERT: A Unified Perspective on Learning Human Motion Representations},
author = {Wentao Zhu and Xiaoxuan Ma and Zhaoyang Liu and Libin Liu and Wayne Wu and Yizhou Wang},
journal= {arXiv preprint arXiv:2210.06551},
year = {2023}
}
备注
ICCV 2023 Camera Ready