中文

VOLMO:面向眼科的通用开放大模型

计算机视觉与模式识别 2026-03-27 v2 新兴技术

摘要

视力障碍影响全球数百万人,早期检测对于防止不可逆视力丧失至关重要。眼科工作流程需要临床医生整合医学图像、结构化临床数据和自由文本笔记以确定疾病严重程度和管理方案,这既耗时又负担沉重。最近的多模态大语言模型(MLLM)显示出前景,但现有的通用和医学 MLLM 在眼科领域表现不佳,且缺乏面向眼科的开放型 MLLM。我们提出了 VOLMO(Versatile and Open Large Models for Ophthalmology),一个面向开发眼科特定 MLLM 的模型无关、数据开放的框架。VOLMO 包括三个阶段:在 86,965 张图像-文本对(来自 26,569 篇 82 期刊的文章)上进行眼科知识预训练;在 26,929 个标注实例(涵盖 12 种眼部疾病,用于疾病筛查和严重程度分类)上进行域任务微调;在 913 例患者病例报告上进行多步骤临床推理,用于评估、规划和随访护理。使用该框架,我们训练了一个紧凑的 20 亿参数 MLLM,并与强大的基线模型进行了比较,包括 InternVL-2B、LLaVA-Med-7B、MedGemma-4B、MedGemma-27B 和 RETFound。我们在图像描述生成、疾病筛查和分期分类、以及评估-管理生成上评估了这些模型,并由两位医务专业人员进行手动审阅,并在年龄相关性黄斑变性和糖尿病性视网膜病变的三个独立队列上进行外部验证。在所有设置下,VOLMO-2B 均优于基线模型,实现了更强的图像描述性能,12 种眼部疾病平均 F1 分为 87.4%,并在外部验证中取得更高分数。

引用

@article{arxiv.2603.23953,
  title  = {VOLMO: Versatile and Open Large Models for Ophthalmology},
  author = {Zhenyue Qin and Younjoon Chung and Elijah Lee and Wanyue Feng and Xuguang Ai and Serina Applebaum and Minjie Zou and Yang Liu and Pan Xiao and Mac Singer and Amisha Dave and Aidan Gilson and Tiarnan D. L. Keenan and Emily Y. Chew and Zhiyong Lu and Yih-Chung Tham and Ron Adelman and Luciano V. Del Priore and Qingyu Chen},
  journal= {arXiv preprint arXiv:2603.23953},
  year   = {2026}
}