LMOD+: 面向眼科多模态大语言模型开发与评估的全面多模态数据集与基准
计算机视觉与模式识别
2026-03-19 v3
摘要
致命性眼部疾病构成全球主要的健康负担,及时诊断受限于人力资源短缺和获取专业护理的限制。尽管多模态大语言模型(MLLM)在医学图像解释方面显示出前景,但缺乏适用于评估生成式模型的全面基准数据集,阻碍了在眼科领域推进 MLLM。我们提出了一个大规模眼科多模态基准,包含 32,633 个实例,覆盖 12 种常见眼科疾病和 5 种影像模态,具备多层次标注。数据集集成了影像、解剖结构、人口学信息和自由文本标注,支持解剖结构识别、疾病筛查、疾病分期和人口学偏差评估。本工作在扩充了的 LMOD 基准上进行三大主要增强:(1)近 50%的数据集扩张,色素图增大;(2)任务覆盖范围扩大,包括二分类疾病诊断、多分类诊断、基于国际分级标准的严重程度分类和人口学预测;(3)系统评估了 24 个最先进的 MLLM。我们的评估揭示了潜力与局限性。顶级模型在零样本设置下实现约 58% 的疾病筛查准确率,而针对疾病分期等具有挑战性的任务的表现仍不理想。我们将公开释放数据集、标注管线和排行榜,以推动眼科人工智能应用,减轻全球视力受威胁疾病的负担。
引用
@article{arxiv.2509.25620,
title = {LMOD+: A Comprehensive Multimodal Dataset and Benchmark for Developing and Evaluating Multimodal Large Language Models in Ophthalmology},
author = {Zhenyue Qin and Yang Liu and Yu Yin and Jinyu Ding and Haoran Zhang and Anran Li and Dylan Campbell and Xuansheng Wu and Ke Zou and Tiarnan D. L. Keenan and Emily Y. Chew and Zhiyong Lu and Yih Chung Tham and Ninghao Liu and Xiuzhen Zhang and Qingyu Chen},
journal= {arXiv preprint arXiv:2509.25620},
year = {2026}
}
备注
ACM Transactions on Computing for Healthcare