中文

面向初级眼科的对话式诊断与分诊的集成语言-视觉基础模型

图像与视频处理 2025-05-14 v1 计算机视觉与模式识别

摘要

当前的深度学习模型大多面向特定任务且缺乏易用的用户界面。我们提出了 Meta-EyeFM,这是一个多功能基础模型,集成了大语言模型(LLM)与视觉基础模型(VFM)用于眼科疾病评估。Meta-EyeFM 通过路由机制,根据文本查询实现精准的任务特定分析。采用低秩适配(Low Rank Adaptation)技术,对我们的视觉模型进行微调,以检测眼部及全身疾病、区分眼部疾病严重程度以及识别常见眼部体征。该模型在路由视网膜图像至合适视觉模型方面实现100%准确率,疾病检测准确率达到≥82.2%,严重程度区分准确率达到≥89%,体征识别准确率达到≥76%。Meta-EyeFM 在检测多种眼部疾病方面比 Gemini-1.5-flash 和 ChatGPT-4o LMM 高出 11% 至 43%,与眼科医生表现相当。该系统提升了可用性和诊断性能,作为初级眼科的决策支持工具或视网膜评估的在线 LLM,具有重要价值。

关键词

引用

@article{arxiv.2505.08414,
  title  = {An integrated language-vision foundation model for conversational diagnostics and triaging in primary eye care},
  author = {Zhi Da Soh and Yang Bai and Kai Yu and Yang Zhou and Xiaofeng Lei and Sahil Thakur and Zann Lee and Lee Ching Linette Phang and Qingsheng Peng and Can Can Xue and Rachel Shujuan Chong and Quan V. Hoang and Lavanya Raghavan and Yih Chung Tham and Charumathi Sabanayagam and Wei-Chi Wu and Ming-Chih Ho and Jiangnan He and Preeti Gupta and Ecosse Lamoureux and Seang Mei Saw and Vinay Nangia and Songhomitra Panda-Jonas and Jie Xu and Ya Xing Wang and Xinxing Xu and Jost B. Jonas and Tien Yin Wong and Rick Siow Mong Goh and Yong Liu and Ching-Yu Cheng},
  journal= {arXiv preprint arXiv:2505.08414},
  year   = {2025}
}