中文

3DReasonKnee:医学视觉语言模型中 grounded reasoning 的进阶

计算机视觉与模式识别 2025-10-27 v1 人工智能

摘要

当前视觉语言模型(VLMs)在医学图像中难以在 3D 医学图像中对解剖区域进行锚定,并以步骤化方式进行推理,这是现实诊断评估的关键要求。这种能力对于将模型输出与临床工作流程一致,实现可信的临床-AI 协作至关重要。现有 3D 数据集提供局部化标签,但不支持这种“锚定推理”能力。为填补这一空白,我们引入 3DReasonKnee,这是首个支持医学图像 3D 锚定推理的数据集,包含 494k 高质量的 quintuples,源自 7,970 个 3D knee MRI 体积。每个 quintuple 包括:(1)3D MRI 体积,(2)针对特定解剖区域的诊断性问题,(3)局部化相关解剖结构的 3D 边界框,(4)由临床医生生成的诊断推理步骤,详细阐述 3D 推理过程,(5)针对相关解剖区域的结构化严重程度评估。3DReasonKnee 的创建和验证耗时超过 450 小时,涉及临床专家手动分割 MR 图像和生成推理链,确保其优异质量和临床相关性。我们建立了 ReasonKnee-Bench 来评估局部化和诊断准确性,洞察 VLM 在解剖区域和诊断问题上的锚定和严重程度评估能力。我们对五种最新 VLMs 进行基准测试,为 ReasonKnee-Bench 提供了基准性能。通过提供专家标注的 3D 推理路径,3DReasonKnee 作为骨科外科医生诊断专业知识的存储库,为将多模态医学 AI 系统推进到 3D、临床对齐、局部化决策能力的测试场提供了关键资源。数据集可在:https://huggingface.co/datasets/rajpurkarlab/3DReasonKnee 访问。

关键词

引用

@article{arxiv.2510.20967,
  title  = {3DReasonKnee: Advancing Grounded Reasoning in Medical Vision Language Models},
  author = {Sraavya Sambara and Sung Eun Kim and Xiaoman Zhang and Luyang Luo and Shreya Johri and Mohammed Baharoon and Du Hyun Ro and Pranav Rajpurkar},
  journal= {arXiv preprint arXiv:2510.20967},
  year   = {2025}
}