OphGLM:基于指令与对话训练眼科大语言与视觉助手
计算机视觉与模式识别
2023-06-23 v2
摘要
大型多模态语言模型(LMMs)在通用领域已取得显著成功。然而,由于医学图像、文本与通用网络内容间存在显著差异,LMMs 在医疗场景中的性能受限。在眼科,临床诊断依赖多模态医学图像,但遗憾的是,多模态眼科大语言模型迄今尚未被探索。本文研究并构建了一个眼科大型多模态模型。首先,以眼底图像为切入点,构建疾病评估与诊断流程,实现常见眼科疾病诊断与病灶分割。随后,基于疾病相关知识和公开真实医疗对话,建立新的眼科多模态指令遵循与对话微调数据集。我们将视觉能力引入大语言模型,以完成眼科大语言与视觉助手(OphGLM)。实验结果表明,OphGLM 模型表现极为出色,并有潜力变革眼科临床应用。数据集、代码与模型将在 https://github.com/ML-AILab/OphGLM 公开。
引用
@article{arxiv.2306.12174,
title = {OphGLM: Training an Ophthalmology Large Language-and-Vision Assistant based on Instructions and Dialogue},
author = {Weihao Gao and Zhuo Deng and Zhiyuan Niu and Fuju Rong and Chucheng Chen and Zheng Gong and Wenze Zhang and Daimin Xiao and Fang Li and Zhenjie Cao and Zhaoyi Ma and Wenbin Wei and Lan Ma},
journal= {arXiv preprint arXiv:2306.12174},
year = {2023}
}
备注
OphGLM:The first ophthalmology large language-and-vision assistant based on instructions and dialogue