中文

一种利用眼底照片与 OCT 图像评估多模态大语言模型的新型眼科基准

计算与语言 2025-03-11 v1

摘要

近年来,大语言模型(LLM)在各种医疗应用中展现出了巨大的潜力。在此基础上,多模态大语言模型(MLLM)将 LLM 与视觉模型相结合,以处理包括临床数据和医学图像在内的多种输入。在眼科领域,人们已探索将 LLM 用于分析光学相干断层扫描(OCT)报告、辅助疾病分类,甚至预测治疗结果。然而,现有的 MLLM 基准往往无法捕捉真实世界临床实践的复杂性,尤其是在 OCT 图像分析方面。许多基准存在样本量小、缺乏多样化 OCT 数据集以及专家验证不足等局限性。这些缺陷阻碍了对 MLLM 解释 OCT 扫描能力及其在眼科领域更广泛适用性的准确评估。我们的数据集经过严格的质量控制和专家标注,包含 439 张眼底图像和 75 张 OCT 图像。使用基于标准化 API 的框架,我们评估了七个主流 MLLM,并观察到不同疾病的诊断准确性存在显著差异。尽管一些模型在诊断糖尿病视网膜病变和年龄相关性黄斑变性等疾病方面表现良好,但它们在处理其他疾病(如脉络膜新生血管和近视)时却显得力不从心,这凸显了性能的不一致性以及进一步完善的必要性。我们的发现强调了开发具有临床相关性的基准以更准确评估 MLLM 能力的重要性。通过完善这些模型并扩大其应用范围,我们可以增强其改变眼科诊断和治疗的潜力。

关键词

引用

@article{arxiv.2503.07094,
  title  = {A Novel Ophthalmic Benchmark for Evaluating Multimodal Large Language Models with Fundus Photographs and OCT Images},
  author = {Xiaoyi Liang and Mouxiao Bian and Moxin Chen and Lihao Liu and Junjun He and Jie Xu and Lin Li},
  journal= {arXiv preprint arXiv:2503.07094},
  year   = {2025}
}