中文

OrthoDoc:用于计算机断层扫描辅助诊断的多模态大语言模型

图像与视频处理 2024-09-17 v1 人工智能 计算机视觉与模式识别

摘要

多模态大语言模型(MLLM)在通用图像处理领域取得了显著成功。其新兴的任务泛化能力和自由形式的对话能力可以极大地促进医学诊断辅助,帮助患者更好地了解病情,并增强医患信任。计算机断层扫描(CT)是一种用于获取患者内部状况的无创成像技术,应用广泛。然而,在以往的研究中,这类成像数据的复杂性使得算法难以准确解读,阻碍了通用大语言模型在诊断辅助中的性能。为此,我们开发了OrthoDoc,一个专为CT诊断设计的MLLM。OrthoDoc在120,000份CT影像和诊断报告上进行了训练,并配备了一个检索增强生成(RAG)模块,该模块能够有效缓解模型幻觉。该模块整合了广泛的医学文献、教科书和解释性数据。因此,OrthoDoc不仅能处理复杂的CT图像,还能存储、推理和理解医学语言。在大量实验中,OrthoDoc的性能优于以GPT-4为代表的商业模型,展现出卓越的诊断能力和准确性。具体而言,在骨折、关节炎和肿瘤等常见骨科疾病的诊断中,OrthoDoc显著超越了现有模型。此外,在处理罕见和复杂病例时,OrthoDoc表现出强大的泛化能力和稳定性。

关键词

引用

@article{arxiv.2409.09052,
  title  = {OrthoDoc: Multimodal Large Language Model for Assisting Diagnosis in Computed Tomography},
  author = {Youzhu Jin and Yichen Zhang},
  journal= {arXiv preprint arXiv:2409.09052},
  year   = {2024}
}

备注

8 pages, 1 figure