面向视网膜图像分析的专业化课程用于训练视觉语言模型
人工智能
2025-02-26 v2
摘要
临床医生会花费大量时间审查医学图像并以文字形式记录其关于患者诊断、转诊和治疗的发现。视觉语言模型(VLM),即自动解释图像并将其发现总结为文字的模型,具有巨大的潜力,以减轻临床工作负担并提高患者获得高质量医疗护理的机会。尽管基础模型在医疗社区引起了 considerable 的兴趣,但其通用能力是否转化为实际的临床实用性尚不清楚。本文我们展示了 OpenAI 的 ChatGPT-4o 模型,以及两款专为医疗用途设计的基础 VLM,在年龄相关性黄斑变性(AMD)患者护理中至关重要的专业任务上,显著低于从事从业眼科医生的表现。为此,我们最初确定了进行基于图像的临床决策所必需的关键能力,然后开发了在这些技能方面选择性训练 VLM 的课程。 resulting 的模型 RetinaVLM 可以被指示编写报告,在疾病分期(F1 分数 0.63 vs. 0.33)和患者转诊(0.67 vs. 0.50)方面显著优于领先的基础医学 VLM 和 ChatGPT-4o,并接近初级眼科医生的诊断水平(后者在各个任务上分别达到 0.77 和 0.78)。此外,在单盲读者研究中,两位拥有最高 32 年经验的资深眼科医生发现 RetinaVLM 的报告显著比 ChatGPT-4o 更准确(64.3% vs. 14.3%)。这些结果强化了我们基于课程的方法为针对实际临床任务专业化基础医学 VLM 提供了蓝图。
引用
@article{arxiv.2407.08410,
title = {Specialized curricula for training vision-language models in retinal image analysis},
author = {Robbie Holland and Thomas R. P. Taylor and Christopher Holmes and Sophie Riedl and Julia Mai and Maria Patsiamanidi and Dimitra Mitsopoulou and Paul Hager and Philip Müller and Hendrik P. N. Scholl and Hrvoje Bogunović and Ursula Schmidt-Erfurth and Daniel Rueckert and Sobha Sivaprasad and Andrew J. Lotery and Martin J. Menten},
journal= {arXiv preprint arXiv:2407.08410},
year = {2025}
}
备注
Under review at npj Digital Medicine