中文

L2A:学习累积姿态历史以提升 3D 人体姿态估计精度

计算机视觉与模式识别 2026-05-13 v2

摘要

现有的 2D-3D 提升人体姿态估计方法已取得显著性能。但对网络深度中历史姿态表示的利用被忽视了。在当前流程中,信息通过固定残差连接传递,这限制了对早期层特征(如细粒度空间结构和短期运动线索)的有效重用。然而, naively 将历史特征跨层纳入并非易事。我们进一步指出,保持跨层一致的表示空间是有效跨层特征聚合的前提。为此,我们提出一种历史感知框架,实现有效的网络跨层历史特征利用。具体而言,我们采用空间-时间平行 Transformer 骨干网络,防止顺序处理中空间-时间转换交替,从而保持一致的表示空间。基于此,我们引入历史姿态累积(History Pose Accumulation, HPA)机制,适应性地聚合来自所有前置层的特征以增强当前表示。此外,我们提出层姿态历史聚合(Layer Pose History Aggregation, LPA)模块,将层姿态特征转换为紧凑且结构化的形式,减少冗余并实现更稳定的聚合。大量实验表明,我们的方法在基准测试上实现了最佳性能。

关键词

引用

@article{arxiv.2605.08806,
  title  = {L2A: Learning to Accumulate Pose History for Accurate 3D Human Pose Estimation},
  author = {Zehua Wang and Changwang Mei and Huaijiang Sun and Pengqi Hu and Zhaoyang Yin},
  journal= {arXiv preprint arXiv:2605.08806},
  year   = {2026}
}

备注

15page