Fundus-R1:基于公开数据的知识感知推理训练基底图像阅读多模态大语言模型
计算机视觉与模式识别
2026-04-10 v1
摘要
基底图像检查(如 CFP、OCT 和 UWF)对于早期检测视网膜异常和疾病至关重要。由于其知识密集型特性,基底图像理解构成一种具有挑战性的视觉-语言任务。当前解决此任务的 emerging 方法是对大量配备高质量临床报告的 in-house 样本进行监督微调(SFT)或利用可验证奖励的强化学习(RLVR)后训练通用多模态大语言模型(MLLM)。然而,这些珍贵样本无法公开获取,这不仅阻碍了可重复性,也实际上限制了研究仅限于少数参与者。为克服这一障碍,我们首次尝试仅使用公开数据集训练一种具备推理能力的基底图像阅读 MLLM,称为 Fundus-R1,其中超过 94%的数据仅标注有图像级别标签。我们的技术贡献有二项:其一,我们提出一种基于 RAG 的方法,用于构建图像特定的、知识感知的推理轨迹。此类自动生成的轨迹将由通用 MLLM识别的视觉发现与图像标签中的视力学知识相联系。其二,我们在 RLVR 中引入过程奖励,以鼓励每个 rollout 中生成推理轨迹的自我一致性。在 FunBench、Omni-Fundus 和 GMAI-Fundus 三个基底图像阅读基准测试上进行的大量实验表明,Fundus-R1 明显优于多个基线模型,包括其通用版本(Qwen2.5-VL)以及不使用生成轨迹即可获得更强后训练版本的模型。这一工作为使用公开数据训练强大的基底图像阅读 MLLM 铺平了道路。
引用
@article{arxiv.2604.08322,
title = {Fundus-R1: Training a Fundus-Reading MLLM with Knowledge-Aware Reasoning on Public Data},
author = {Yuchuan Deng and Qijie Wei and Kaiheng Qian and Jiazhen Liu and Zijie Xin and Bangxiang Lan and Jingyu Liu and Jianfeng Dong and Xirong Li},
journal= {arXiv preprint arXiv:2604.08322},
year = {2026}
}