EyecareGPT:通过量身定制的数据集、基准测试与模型提升全面眼科理解能力
计算机视觉与模式识别
2025-04-21 v1
摘要
医学大规模视觉语言模型(Med-LVLMs)在医疗保健领域展现出巨大的潜力,但其依赖通用医学数据和粗糙的全局视觉理解,限制了其在智能化眼科诊断中的应用。当前,智能化眼科诊断面临三个主要挑战:(i)数据。缺乏深层标注、高质量、多模态的眼科视觉指令数据;(ii)基准测试。缺乏用于评估诊断性能的全面且系统的基准测试;(iii)模型。难以将整体视觉架构适应于细粒度、区域特定的眼科病灶识别。本文提出了Eyecare Kit,通过量身定制的数据集、基准测试与模型系统性地解决上述三个关键挑战:首先,我们构建了一个基于真实眼科数据的多主体数据引擎,生成Eyecare-100K数据集,这是一个高质量的眼科视觉指令数据集。随后,我们设计了Eyecare-Bench,一个全面评估LVLMs在智能化眼科诊断任务中整体性能的基准测试,涵盖多个维度。最后,我们开发了EyecareGPT,针对细粒度眼科视觉理解进行了深度优化,包含自适应分辨率机制和层级稠密连接器。大量实验结果表明,EyecareGPT 在多种眼科任务中实现了最先进的性能,凸显了其在推动智能化眼科诊断开放研究方面的重要潜力。我们的项目已公开于 https://github.com/DCDmllm/EyecareGPT。
引用
@article{arxiv.2504.13650,
title = {EyecareGPT: Boosting Comprehensive Ophthalmology Understanding with Tailored Dataset, Benchmark and Model},
author = {Sijing Li and Tianwei Lin and Lingshuai Lin and Wenqiao Zhang and Jiang Liu and Xiaoda Yang and Juncheng Li and Yucheng He and Xiaohui Song and Jun Xiao and Yueting Zhuang and Beng Chin Ooi},
journal= {arXiv preprint arXiv:2504.13650},
year = {2025}
}