中文

面向古生物学 X 光档案的零样态大型视觉语言模型提示用于自动骨骼识别

计算机视觉与模式识别 2026-02-04 v1 人工智能

摘要

古生物学 (paleoradiology) 利用现代成像技术研究考古和人类学遗存,为人类健康的千年尺度模式提供了新视角。然而,现场征收的 X 光片组织化:骨骼未脱节、定位随意且常缺乏侧向标记。此外,因素如死亡时年龄、骨骼年龄、性别以及成像设备的不同,引入了高度的变异性。因此,内容导航(例如识别具有特定投影视图的图像子集)可能耗时且困难,使高效的初步分析成为专家分析的瓶颈。我们报告了一种零样提示策略,利用最先进的大型视觉语言模型 (LVLM) 自动识别主要骨骼、投影视图和侧向性。在管道线中,我们将原始 DICOM 文件转换为骨骼窗口 PNG 文件,提交给 LVLM 并附上精心设计的提示,然后接收结构化 JSON 输出,提取并格式化到电子表格中,以准备进行验证。在随机抽取的 100 张经专家委员会认证的古生物学放射科医生审核的图像样本中,该系统实现了 92% 的主要骨骼准确率、80% 的投影视图准确率和 100% 的侧向性准确率,同时对模糊情况标记为低或中置信度。这类结果表明 LVLM 可显著加速大型古生物学数据集的 code word 开发,使未来人类学工作流程中的高效内容导航成为可能。

关键词

引用

@article{arxiv.2602.03750,
  title  = {Zero-shot large vision-language model prompting for automated bone identification in paleoradiology x-ray archives},
  author = {Owen Dong and Lily Gao and Manish Kota and Bennett A. Landmana and Jelena Bekvalac and Gaynor Western and Katherine D. Van Schaik},
  journal= {arXiv preprint arXiv:2602.03750},
  year   = {2026}
}