中文

婴儿姿态估计基于2D图像的无标记方法比较

计算机视觉与模式识别 2025-04-24 v3

摘要

本研究比较了现有通用型和婴儿姿态估计器在基于视频的自动化一般运动评估(GMA)中的性能,以及不同摄像机视角(常规对角线视角用于GMA vs. 俯视视角)对于最佳录制的选择。我们使用了75段婴儿自发运动功能录像中4500个标注视频帧进行分析。为确定哪种姿态估计方法和摄像机视角在GMA相关场景中能获得最佳姿态估计精度,我们计算并比较了到人类注释的距离和正确关键点百分比(PCK)。结果表明,最佳表现的通用模型(在成年人上训练)ViTPose也在婴儿上表现最佳。我们看到使用婴儿姿态估计器与通用姿态估计器在婴儿数据集上没有改善。然而,当在我们的数据集上重新训练通用模型时,姿态估计精度有显著提升。从对角线视角获得的姿态估计精度明显低于俯视视角获得的精度,尤其对于髋部关键点的检测。结果还表明,婴儿姿态估计器对其他婴儿数据集的泛化能力有限,这暗示在选择婴儿姿态估计器时应谨慎,并小心在其未训练的数据集上使用。虽然标准GMA方法使用对角线视角进行评估,但姿态估计精度显著提升。这表明应包括在自动化GMA研究的录制设置中使用俯视视角。

关键词

引用

@article{arxiv.2410.04980,
  title  = {Comparison of marker-less 2D image-based methods for infant pose estimation},
  author = {Lennart Jahn and Sarah Flügge and Dajie Zhang and Luise Poustka and Sven Bölte and Florentin Wörgötter and Peter B Marschik and Tomas Kulvicius},
  journal= {arXiv preprint arXiv:2410.04980},
  year   = {2025}
}