中文

OrthoInsight:基于多模态大模型的肋骨骨折诊断与报告生成

图像与视频处理 2026-01-30 v4 人工智能 计算机视觉与模式识别

摘要

日益增长的医学影像数据加大了对自动化诊断工具的需求,尤其是通常通过 CT 扫描检测的肋骨骨折等肌肉骨骼损伤。人工判读耗时且易出错。我们提出了 OrthoInsight,一个用于肋骨骨折诊断与报告生成的多模态深度学习框架。该框架集成了用于骨折检测的 YOLOv9 模型、用于检索临床上下文的医学知识图谱,以及用于生成诊断报告的微调 LLaVA 语言模型。OrthoInsight 将来自 CT 图像的视觉特征与专家文本数据相结合,以提供具有临床实用价值的输出。在 28,675 张带标注的 CT 图像及专家报告上进行评估,该框架在诊断准确性、内容完整性、逻辑连贯性和临床指导价值方面均取得高性能,平均得分为 4.28,优于 GPT-4 和 Claude-3 等模型。本研究展示了多模态学习在变革医学图像分析并为放射科医师提供有效支持方面的潜力。

关键词

引用

@article{arxiv.2507.13993,
  title  = {OrthoInsight: Rib Fracture Diagnosis and Report Generation Based on Multi-Modal Large Models},
  author = {Ningyong Wu and Jiangbo Zhang and Wenhong Zhao and Jinzhi Wang and Chenzhan Yu and Zhigang Xiu and Duwei Dai and Ziyu Xu and Yongli Yang},
  journal= {arXiv preprint arXiv:2507.13993},
  year   = {2026}
}