中文

基于视频的3D人体姿态与形状估计的全局到局部建模

计算机视觉与模式识别 2023-03-28 v1

摘要

基于视频的3D人体姿态与形状估计由帧内精度与帧间平滑度进行评价。尽管这两个指标对应不同时域一致性的范围,现有最先进(SOTA)方法将其视为统一问题,并采用单调的建模结构(如 RNN 或基于注意力的模块)设计网络。然而,使用单一建模结构难以平衡短期与长期时间相关性的学习,并可能使网络偏向其中之一,导致全局位置偏移、时间不一致及局部细节不足等不良预测。为解决这些问题,我们提出在端到端框架 Global-to-Local Transformer (GLoT) 中结构性解耦长期与短期相关性的建模。首先,引入全局 transformer 并采用掩码姿态与形状估计策略进行长期建模;该策略通过随机掩码若干帧的特征来激励全局 transformer 学习更多帧间相关性。其次,局部 transformer 负责挖掘人体网格上的局部细节,并通过交叉注意力与全局 transformer 交互。此外,进一步引入分层空间相关性回归器,通过解耦的全局-局部表示与隐式运动学约束来细化帧内估计。我们的 GLoT 在 3DPW、MPI-INF-3DHP 与 Human3.6M 等流行基准上以最低模型参数量超越了先前 SOTA 方法。代码见 https://github.com/sxl142/GLoT。

关键词

引用

@article{arxiv.2303.14747,
  title  = {Global-to-Local Modeling for Video-based 3D Human Pose and Shape Estimation},
  author = {Xiaolong Shen and Zongxin Yang and Xiaohan Wang and Jianxin Ma and Chang Zhou and Yi Yang},
  journal= {arXiv preprint arXiv:2303.14747},
  year   = {2023}
}