用于视频中人体姿态估计的运动学感知分层注意力网络
计算机视觉与模式识别
2022-11-30 v1
摘要
先前基于视频的人体姿态估计方法通过利用连续帧的聚合特征已展示出有前景的结果。然而,多数方法为减轻抖动而牺牲精度,或未能充分理解人体运动的时间特性。此外,遮挡增加了连续帧间的不确定性,导致结果不平滑。为解决这些问题,我们设计了一种利用关键点运动学特征的架构,包含以下组件。首先,我们通过利用各关键点的速度与加速度有效捕获时间特征。其次,所提分层 transformer 编码器聚合时空依赖并精炼由现有估计器估计的 2D 或 3D 输入姿态。最后,我们提供编码器生成的精炼输入姿态与解码器最终姿态间的在线交叉监督以实现联合优化。我们展示了综合结果,并在多项任务中验证模型有效性:2D 姿态估计、3D 姿态估计、身体网格恢复及稀疏标注多人姿态估计。我们的代码见于 https://github.com/KyungMinJin/HANet。
引用
@article{arxiv.2211.15868,
title = {Kinematic-aware Hierarchical Attention Network for Human Pose Estimation in Videos},
author = {Kyung-Min Jin and Byoung-Sung Lim and Gun-Hee Lee and Tae-Kyung Kang and Seong-Whan Lee},
journal= {arXiv preprint arXiv:2211.15868},
year = {2022}
}