中文

MedSapiens:以姿态为基础,重新思考医学影像中 landmarks 检测

计算机视觉与模式识别 2025-11-07 v1 人工智能 机器学习

摘要

本文并不提出新架构;相反,它重新审视了一个被忽视的基本基线:将人类中心的基础模型适用于医学影像中的解剖 landmarks 检测。虽然landmark检测传统上依赖于特定于领域的模型,但大规模预训练视觉模型的出现带来了新的机遇。在本研究中,我们调查了将Sapiens——一个为姿态估计设计的人类中心基础模型——适用于医学影像,通过多数据集预训练,建立了在多个数据集上建立了新的状态最佳成绩。我们提出的MedSapiens模型证明,人类中心的基础模型天然优化用于空间姿态定位,为解剖landmark检测提供了强大的先验条件,但这一潜力至今鲜有被利用。我们对MedSapiens与现有最先进模型进行基准测试,在平均成功检测率(SDR)方面实现了相对于通用模型提升最高可达5.26%,相对于专家模型提升最高可达21.81%。为进一步评估MedSapiens在带有限标注的新下游任务中的可适应性,我们评估了其在有限数据设置下的性能,在SDR方面相对于few-shot最先进方法实现了2.69%的提升。代码和模型权重可在 https://github.com/xmed-lab/MedSapiens 获取。

关键词

引用

@article{arxiv.2511.04255,
  title  = {MedSapiens: Taking a Pose to Rethink Medical Imaging Landmark Detection},
  author = {Marawan Elbatel and Anbang Wang and Keyuan Liu and Kaouther Mouheb and Enrique Almar-Munoz and Lizhuo Lin and Yanqi Yang and Karim Lekadir and Xiaomeng Li},
  journal= {arXiv preprint arXiv:2511.04255},
  year   = {2025}
}