利用跨步 Transformer 的时间上下文进行 3D 人体姿态估计
计算机视觉与模式识别
2022-01-12 v8
摘要
尽管从视频中进行 3D 人体姿态估计已取得巨大进展,如何充分利用冗余的 2D 姿态序列来学习代表性表征以生成单个 3D 姿态仍是一个开放问题。为此,我们提出一种改进的基于 Transformer 的架构,称为 Strided Transformer,其简洁有效地将长序列的 2D 关节位置提升为单个 3D 姿态。具体而言,采用 Vanilla Transformer 编码器(VTE)对 2D 姿态序列的长程依赖进行建模。为降低序列冗余,VTE 前馈网络中的全连接层被跨步卷积替代,以逐步缩减序列长度并聚合局部上下文信息。修改后的 VTE 被称为 Strided Transformer 编码器(STE),其构建于 VTE 的输出之上。STE 不仅以分层全局与局部方式有效地将长程信息聚合为单向量表征,还显著降低了计算成本。此外,设计了一种全到单监督方案,分别应用于 VTE 与 STE 的输出,在全序列与单目标帧尺度上进行监督。该方案结合单目标帧监督施加了额外的时序平滑约束,从而有助于生成更平滑且更准确的 3D 姿态。所提出的 Strided Transformer 在两个具挑战性的基准数据集 Human3.6M 与 HumanEva-I 上进行了评估,以更少的参数量取得了最先进的结果。代码与模型见 \url{https://github.com/Vegetebird/StridedTransformer-Pose3D}。
引用
@article{arxiv.2103.14304,
title = {Exploiting Temporal Contexts with Strided Transformer for 3D Human Pose Estimation},
author = {Wenhao Li and Hong Liu and Runwei Ding and Mengyuan Liu and Pichao Wang and Wenming Yang},
journal= {arXiv preprint arXiv:2103.14304},
year = {2022}
}
备注
Accepted by IEEE Transactions on Multimedia. Open sourced