婴儿 2D 姿态估计从视频中自动推断:比较七种深度神经网络方法
计算机视觉与模式识别
2025-09-12 v4
摘要
从普通视频中对婴儿姿态和运动进行无标记自动估计具有巨大的潜力,有助于“野外”运动研究,促进运动发育理解,并大幅提高早期诊断障碍的机会。由于深度学习和机器学习的进步,人类姿态估计方法在计算机视觉领域取得了快速发展。然而,这些方法是在包含成年人的不同情境的数据集上训练的。本工作测试和比较了七种流行方法(AlphaPose、DeepLabCut/DeeperCut、Detectron2、HRNet、MediaPipe/BlazePose、OpenPose 和 ViTPose)在婴儿仰卧位置以及更复杂环境下的视频表现。意外的是,除 DeepLabCut 和 MediaPipe 外,所有方法在无需额外微调的情况下都表现出竞争力,其中 ViTPose 性能最佳。除了标准性能指标(平均精度和召回率)外,我们还引入以颈部-髋中点(躯干长度)比例表示的误差,并额外研究漏检和冗余检测以及不同方法内部置信度评级的可靠性,这些都是下游任务所关心的。对于具有竞争力的网络,只有 AlphaPose 能在我们的机器上接近实时运行(27 fps)。我们提供了我们所使用的所有方法的文档化 Docker 容器或说明、我们的分析脚本以及处理后的数据,链接为 https://hub.docker.com/u/humanoidsctu 和 https://osf.io/x465b/。
引用
@article{arxiv.2406.17382,
title = {Automatic infant 2D pose estimation from videos: comparing seven deep neural network methods},
author = {Filipe Gama and Matej Misar and Lukas Navara and Sergiu T. Popescu and Matej Hoffmann},
journal= {arXiv preprint arXiv:2406.17382},
year = {2025}
}
备注
38 pages, 8 figures, 22 tables