基于可微相机投影的多视角手术室视频三维人体姿态估计
计算机视觉与模式识别
2023-08-31 v1
摘要
多视角手术室(OR)视频中的三维人体姿态估计是人员跟踪与动作识别的重要辅助手段。然而,手术环境因无菌服、频繁遮挡以及公开数据有限,使得姿态估计颇具挑战。专为手术室设计的方法通常基于多相机视角中检测到的姿态的融合。典型做法是,先由卷积神经网络(CNN)等二维姿态估计器检测关节位置,再将检测到的关节位置投影至三维并在所有相机视角上融合。然而,二维的准确检测并不能保证三维空间中的准确定位。本工作中,我们提出通过基于三维损失端到端训练二维CNN来直接优化三维定位,该损失经由各相机投影参数反向传播。利用MVOR数据集中的视频,我们表明这种端到端方法优于二维空间中的优化。
引用
@article{arxiv.2210.11826,
title = {3D Human Pose Estimation in Multi-View Operating Room Videos Using Differentiable Camera Projections},
author = {Beerend G. A. Gerats and Jelmer M. Wolterink and Ivo A. M. J. Broeders},
journal= {arXiv preprint arXiv:2210.11826},
year = {2023}
}
备注
12 pages, 4 figures, submitted to the 2022 AE-CAI Special Issue of Computer Methods in Biomechanics and Biomedical Engineering: Imaging & Visualization