中文

NanoHTNet:用于高效 3D 人体姿态估计的纳米人类拓扑网络

计算机视觉与模式识别 2025-10-21 v2

摘要

3D 人体姿态估计 (HPE) 的广泛应用受限于资源受限的边缘设备,要求更高效的模型。提高效率的一个关键方法是基于输入数据结构特征设计网络。然而,有效利用人类骨骼输入中的显式和隐式结构先验仍然具有挑战性。为了解决这个问题,我们通过创新的模型设计和预训练代理任务,利用人类身体的显式和隐式时空先验。首先,我们提出了纳米人类拓扑网络 (NanoHTNet),一个小型 3D HPE 网络,包含堆叠的层次混合器来捕获显式特征。具体而言,空间层次混合器高效地跨多个语义层次学习人类物理拓扑,而具有离散余弦变换和低通滤波的时序层次混合器捕获局部瞬时运动和全局动作一致性。此外,引入了高效时空分块 (ETST),以增强时空相互作用并显著降低计算复杂度。其次,提出了基于对比学习的 PoseCLR 作为 3D HPE 的通用预训练方法,旨在提取人类拓扑的隐式表示。通过对齐来自不同视角的 2D 姿态,PoseCLR 帮助 3D HPE 编码器如 NanoHTNet 更有效地捕获人体的高维特征,从而进一步提高性能。广泛的实验验证了 NanoHTNet 配合 PoseCLR 在效率方面优于其他最新方法,使其适用于 Jetson Nano 等边缘设备。代码和模型均可在 https://github.com/vefalun/NanoHTNet 获取。

关键词

引用

@article{arxiv.2501.15763,
  title  = {NanoHTNet: Nano Human Topology Network for Efficient 3D Human Pose Estimation},
  author = {Jialun Cai and Mengyuan Liu and Hong Liu and Shuheng Zhou and Wenhao Li},
  journal= {arXiv preprint arXiv:2501.15763},
  year   = {2025}
}

备注

Accepted by TIP 2025, Open Sourced