LMOD:面向大型视觉语言模型的大型多模态眼科学数据集与基准
计算机视觉与模式识别
2025-02-06 v5
摘要
视力危及的眼部疾病患病率是全球负担的重要组成部分,许多病例要么未被诊断,要么被诊断过于晚难及有效治疗。大型视觉语言模型(LVLMs)有望帮助理解解剖信息、诊断眼部疾病并撰写解读与随访计划,从而减轻临床医生的负担并提高眼科护理的可及性。然而,现有数据集不足以评估LVLMs在眼科特定应用中的性能。本研究引入 LMOD,一个大规模多模态眼科基准,包含 21,993 个实例,涵盖(1)五种眼科成像模态:光学相干断层扫描、彩色 Fundus 照片、扫描激光眼底相机、镜片照片和手术场景;(2)自由文本、人口学信息和疾病生物标志物信息;(3)眼科特定应用,如解剖信息理解、疾病诊断和亚群分析。此外,我们对 13 个最先进的 LVLM 代表进行了基准测试,来自闭源、开源和医疗领域。结果显示,LVLMs 在眼科领域的性能显著下降。系统性错误分析进一步识别了六大主要失效模式:误分类、未能放弃、推理不一致、幻觉、缺乏依据的断言以及缺乏领域特定知识。相比之下,针对这些任务专门训练的监督式神经网络作为基准表现出高准确率。这凸显了在眼科特定LVLMs的开发与验证中亟需基准测试的紧迫性。
引用
@article{arxiv.2410.01620,
title = {LMOD: A Large Multimodal Ophthalmology Dataset and Benchmark for Large Vision-Language Models},
author = {Zhenyue Qin and Yu Yin and Dylan Campbell and Xuansheng Wu and Ke Zou and Yih-Chung Tham and Ninghao Liu and Xiuzhen Zhang and Qingyu Chen},
journal= {arXiv preprint arXiv:2410.01620},
year = {2025}
}
备注
2025 NAACL: Annual Conference of the Nations of the Americas Chapter of the Association for Computational Linguistics Project Page: https://kfzyqin.github.io/lmod/