跨数据集人体姿态估计:一种统一骨架与多教师蒸馏方法
计算机视觉与模式识别
2024-05-31 v1
摘要
人体姿态估计是计算机视觉中的关键任务,具有多种应用,如活动识别和交互系统。然而,不同数据集中标注骨架的不一致性给开发通用模型带来了挑战。为了解决这一挑战,我们提出了一种新颖的方法,将多教师知识蒸馏与统一骨架表示相结合。我们的网络在COCO和MPII数据集上联合训练,分别包含17和16个关键点。我们通过预测扩展的21个关键点(比原始标注多4个(COCO)和5个(MPII))展示了增强的适应性,提高了跨数据集的泛化能力。我们的联合模型在平均准确率上分别达到70.89和76.40,而单数据集训练并在两个数据集上评估时分别为53.79和55.78。此外,我们还通过报告在Halpe数据集上的AP为66.84和72.75来评估两个模型预测的所有21个点。这突显了我们的技术解决姿态估计研究和应用中最紧迫挑战之一——骨架标注不一致性的潜力。
引用
@article{arxiv.2405.20084,
title = {Estimating Human Poses Across Datasets: A Unified Skeleton and Multi-Teacher Distillation Approach},
author = {Muhammad Saif Ullah Khan and Dhavalkumar Limbachiya and Didier Stricker and Muhammad Zeshan Afzal},
journal= {arXiv preprint arXiv:2405.20084},
year = {2024}
}
备注
15 pages (with references)