面向可泛化膝关节病理的多模态视觉基础模型
计算机视觉与模式识别
2026-01-27 v1 人工智能
摘要
肌肉骨骼疾病是全球致残的主要原因之一,对医学影像的精准判读提出了迫切需求。当前骨科领域的人工智能(AI)方法主要依赖于特定任务的监督学习范式。这些方法本质上是碎片化的,需要大量标注数据集,且通常缺乏在不同模态和临床场景间的泛化能力。该领域基础模型的发展受限于大规模、经筛选且开源的肌肉骨骼数据集的稀缺。为应对这些挑战,我们推出了 OrthoFoundation,一个针对肌肉骨骼病理优化的多模态视觉基础模型。我们利用内部和公开数据库构建了包含 120 万张无标注膝关节 X 射线与 MRI 图像的预训练数据集。利用 Dinov3 主干网络,该模型通过自监督对比学习进行训练,以捕获稳健的放射学特征表示。OrthoFoundation 在 14 项下游任务中取得了最先进(SOTA)的性能。它在 X 射线骨关节炎诊断中获得了卓越的准确率,并在 MRI 结构性损伤检测中排名第一。该模型展现出显著的标签效率,仅使用 50% 的标注数据即可匹敌监督基线。此外,尽管仅在膝关节图像上进行预训练,OrthoFoundation 对髋部、肩部和踝部表现出了出色的跨解剖结构泛化能力。OrthoFoundation 标志着向肌肉骨骼影像通用 AI 迈出的重要一步。通过从大规模多模态数据中学习基础且与关节无关的放射学语义,它克服了传统模型的局限性,为在临床实践中减轻标注负担和提高诊断准确率提供了稳健的框架。
引用
@article{arxiv.2601.18250,
title = {A multimodal vision foundation model for generalizable knee pathology},
author = {Kang Yu and Dingyu Wang and Zimu Yuan and Nan Zhou and Jiajun Liu and Jiaxin Liu and Shanggui Liu and Yaoyan Zheng and Huishu Yuan and Di Huang and Dong Jiang},
journal= {arXiv preprint arXiv:2601.18250},
year = {2026}
}