ER-Pose:重新思考基于关键点的驱动的实时人体姿态估计
计算机视觉与模式识别
2026-03-10 v1
摘要
单阶段多人姿态估计旨在在统一框架内联合执行人体局部分析和关键点预测,具有推理效率和架构简单性等优势。因此,广泛采用多尺度实时检测架构,如YOLO类模型,用于实时姿态估计。然而,这些方法通常继承了来自目标检测的盒子驱动建模范式,其中姿态估计在训练期间受到边界框监督的隐式约束。这一表述引入了样本分配和特征表示方面的偏差,导致任务错位,最终限制了姿态估计精度。本文从关键点驱动的角度重新审视盒子驱动的单阶段姿态估计,识别出平行目标之间的语义冲突是性能下降的关键源。为解决此问题,我们提出了关键点驱动的学习范式,将姿态估计提升为主要预测目标。具体而言,我们移除边界框预测并重新设计预测头以更好地适应姿态估计的高维结构表示。我们进一步引入关键点驱动的动态样本分配策略,以将训练目标与姿态评估指标对齐,实现训练期间的稠密监督和高效的NMS-free推理。此外,我们提出了基于平滑OKS的损失函数,以稳定回归基于姿态估计的优化。基于这些设计,我们开发了一个单阶段多人姿态估计框架,称为ER-Pose。在MS COCO和CrowdPose数据集上,ER-Pose-n在无预训练和有预训练情况下的AP提升分别为3.2/6.7和7.4/4.9。这些改进是通过更少的参数和更高的推理效率实现的。
引用
@article{arxiv.2603.08681,
title = {ER-Pose: Rethinking Keypoint-Driven Representation Learning for Real-Time Human Pose Estimation},
author = {Nanjun Li and Pinqi Cheng and Zean Liu and Minghe Tian and Xuanyin Wang},
journal= {arXiv preprint arXiv:2603.08681},
year = {2026}
}