中文

直播流中时序嵌入的 3D 人体姿态与形状估计

计算机视觉与模式识别 2022-07-27 v1

摘要

时序序列中的 3D 人体姿态与形状估计对理解人类行为十分关键。尽管近年来基于单图像或视频的人体姿态估计取得显著进展,考虑到直播流视频对实时输出与时序一致性的特殊要求,其上的人体运动估计仍是鲜有触及的领域。为此,我们提出时序嵌入的 3D 人体姿态与形状估计(TePose)方法,以提升直播流视频中姿态估计的精度与时序一致性。TePose 利用先前预测作为桥梁,反馈误差以改进当前帧估计,并学习历史数据帧与预测间的对应关系。我们提出多尺度时空图卷积网络作为运动判别器,利用无任何 3D 标注的数据集进行对抗训练。我们提出顺序数据加载策略以满足直播流特殊的端到端数据处理需求。我们通过大量实验证明了各提出模块的重要性。结果表明 TePose 在广泛使用的人体姿态基准上以 SOTA 性能展现了有效性。

关键词

引用

@article{arxiv.2207.12537,
  title  = {Live Stream Temporally Embedded 3D Human Body Pose and Shape Estimation},
  author = {Zhouping Wang and Sarah Ostadabbas},
  journal= {arXiv preprint arXiv:2207.12537},
  year   = {2022}
}