中文

PoseBERT:用于时序三维人体建模的通用 Transformer 模块

计算机视觉与模式识别 2022-10-20 v2

摘要

在视频中训练用于人体姿态估计的最先进模型需要带有标注的数据集,这些数据集获取起来非常困难且昂贵。尽管 transformer 近期已被用于身体姿态序列建模,相关方法依赖伪真值来扩充当前可用于学习此类模型的有限训练数据。在本文中,我们引入 PoseBERT,一个通过掩码建模在三维动作捕捉(MoCap)数据上充分训练的 transformer 模块。它简单、通用且多功能,因为它可以插在任何基于图像的模型之上,利用时序信息将其转变为基于视频的模型。我们展示了 PoseBERT 的多种变体,其输入从三维骨架关键点变化到三维参数化模型(全身 SMPL 或仅手部 MANO)的旋转。由于 PoseBERT 训练是任务无关的,该模型可应用于若干任务,如姿态精化、未来姿态预测或运动补全而无需微调。我们的实验结果验证,在各种最先进姿态估计方法之上添加 PoseBERT 一致地提升了它们的性能,同时其低计算成本使我们能在实时演示中通过摄像头平滑驱动机械手动画。测试代码和模型可在 https://github.com/naver/posebert 获取。

关键词

引用

@article{arxiv.2208.10211,
  title  = {PoseBERT: A Generic Transformer Module for Temporal 3D Human Modeling},
  author = {Fabien Baradel and Romain Brégier and Thibault Groueix and Philippe Weinzaepfel and Yannis Kalantidis and Grégory Rogez},
  journal= {arXiv preprint arXiv:2208.10211},
  year   = {2022}
}

备注

Accepted to TPAMI 2022