RetinalGPT:一个由大型视觉-语言模型驱动的视网膜临床偏好对话助手
计算机视觉与模式识别
2025-03-07 v1 人工智能
计算与语言
机器学习
摘要
最近,多模态大语言模型(MLLM)因其处理和分析非文本数据(如图像、视频和音频)的卓越能力而受到广泛关注。值得注意的是,已经探索了将通用领域 MLLM 适配到医学领域的几种方法,包括 LLaVA-Med。然而,这些医学适配在理解和解释视网膜图像方面仍然不够充分。相反,医学专家强调定量分析对疾病检测和解释的重要性。这凸显了通用领域与医学领域 MLLM 之间的差距:虽然通用领域 MLLM 在广泛应用中表现出色,但它们缺乏医学领域精确诊断和解释任务所需的专业知识。为了解决这些挑战,我们引入了 RetinalGPT,一个用于视网膜图像临床偏好定量分析的多模态对话助手。具体而言,我们通过编译大型视网膜图像数据集、开发新型数据管道以及采用定制化的视觉指令调优来实现这一目标,从而增强视网膜分析并丰富医学知识。特别是,RetinalGPT 在 8 个基准视网膜数据集的视网膜疾病诊断方面大幅超越了通用领域 MLLM。除了疾病诊断之外,RetinalGPT 还具备定量分析和病灶定位功能,代表了利用 LLM 实现可解释端到端临床研究框架的开创性步骤。代码可在 https://github.com/Retinal-Research/RetinalGPT 获取。
引用
@article{arxiv.2503.03987,
title = {RetinalGPT: A Retinal Clinical Preference Conversational Assistant Powered by Large Vision-Language Models},
author = {Wenhui Zhu and Xin Li and Xiwen Chen and Peijie Qiu and Vamsi Krishna Vasa and Xuanzhao Dong and Yanxi Chen and Natasha Lepore and Oana Dumitrascu and Yi Su and Yalin Wang},
journal= {arXiv preprint arXiv:2503.03987},
year = {2025}
}