中文

用于三维人体姿态估计的精炼时序金字塔压缩-放大 Transformer

计算机视觉与模式识别 2024-02-06 v3 人工智能

摘要

在视频序列中准确估计人体三维姿态既需要精度也需要结构良好的架构。随着 Transformer 的成功,我们引入了精炼时序金字塔压缩-放大(RTPCA)Transformer。利用时间维度,RTPCA 通过其时序金字塔压缩-放大(TPCA)结构扩展块内时序建模,并借助跨层精炼(XLR)模块细化块间特征交互。特别地,TPCA 块利用时序金字塔范式,强化键与值表征能力,并无缝从运动序列中提取空间语义。我们将这些 TPCA 块与 XLR 缝合,后者通过查询、键和值的持续交互促进丰富语义表征。该策略将早期阶段信息融入当前流中,解决了其他基于 Transformer 的方法中常见的细节与稳定性不足问题。我们以最小计算开销在 Human3.6M、HumanEva-I 和 MPI-INF-3DHP 基准上取得最先进结果,从而证明了 RTPCA 的有效性。源代码见 https://github.com/hbing-l/RTPCA。

关键词

引用

@article{arxiv.2309.01365,
  title  = {Refined Temporal Pyramidal Compression-and-Amplification Transformer for 3D Human Pose Estimation},
  author = {Hanbing Liu and Wangmeng Xiang and Jun-Yan He and Zhi-Qi Cheng and Bin Luo and Yifeng Geng and Xuansong Xie},
  journal= {arXiv preprint arXiv:2309.01365},
  year   = {2024}
}

备注

11 pages, 5 figures