中文

Retina-RAG:用于联合视网膜诊断与临床报告生成的检索增强视觉语言建模

计算机视觉与模式识别 2026-05-11 v2 人工智能

摘要

糖尿病视网膜病变(DR)是全球工作年龄成年人可预防性失明的主要原因,但大多数自动筛查系统仅限于图像级分类,缺乏临床结构化报告。我们提出了 Retina-RAG,一个低成本模块化框架,可联合执行 DR 严重程度分级、黄斑水肿(ME)检测和报告生成。该架构将高性能视网膜分类器与通过低秩自适应(LoRA)适配的参数高效视觉语言模型(Qwen2.5-VL-7B-Instruct)解耦,从而实现灵活的组件集成。检索增强生成(RAG)模块在推理时注入精心策划的眼科知识以及结构化分类器输出,以提高诊断一致性并减少幻觉。Retina-RAG 在 DR 分级上达到 0.731 的 F1 分数,在 ME 检测上达到 0.948,在带有字幕的视网膜疾病检测数据集上大幅优于零样本 Qwen(0.096, 0.732)和 MMed-RAG(0.541, 0.641)。对于报告生成,Retina-RAG 达到 ROUGE-L 0.438 和 SBERT 相似度 0.884,超越了所有基线。整个框架在单块消费级 GPU 上运行,表明只需适度的计算资源即可实现临床结构化的视网膜 AI。

关键词

引用

@article{arxiv.2605.06173,
  title  = {Retina-RAG: Retrieval-Augmented Vision-Language Modeling for Joint Retinal Diagnosis and Clinical Report Generation},
  author = {Abdelrahman Zaian and Sheethal Bhat and Mohamed Abdalkader and Andreas Maier},
  journal= {arXiv preprint arXiv:2605.06173},
  year   = {2026}
}

备注

10 pages, 5 figures. Submitted to MICCAI 2026