GROK:从定量生物标志物到定性诊断的扎根式大语言多模态模型
人工智能
2025-10-07 v1
摘要
多模态大语言模型(MLLM)在整合多样数据模态方面具有潜力,但当前医学适配方案(如 LLaVA-Med)往往未能充分发挥色素图谱(CFP)和光学相干断层扫描(OCT)之间的协同作用,同时对定量生物标志物的可解释性有限。我们引入 GROK,这是一个扎根式多模态大语言模型,能够联合处理 CFP、OCT 和文本,为眼部和全身疾病提供临床水平的诊断。GROK 由三个核心模块组成:知识引导指令生成、CLIP 风格的 OCT-生物标志物对齐,以及监督式指令微调,共同构建从定量到定性的诊断链式思维,模拟真实临床推理过程,生成详细的病灶注释。为评估 our 方法,我们引入了 Grounded Ophthalmic Understanding 基准,覆盖六类疾病和三个任务:宏观诊断分类、报告生成质量以及对生成链式思维的细粒度临床评估。实验表明,仅通过 LoRA 微调 7B 参数的 Qwen2 主干模型,GROK 在报告质量和细粒度临床指标上均优于 7B 和 32B 的对比基线,甚至超越了 OpenAI o3。代码和数据已在 GROK 仓库公开。
引用
@article{arxiv.2510.04281,
title = {GROK: From Quantitative Biomarkers to Qualitative Diagnosis via a Grounded MLLM with Knowledge-Guided Instruction},
author = {Zhuangzhi Gao and Hongyi Qin and He Zhao and Qinkai Yu and Feixiang Zhou and Eduard Shantsila and Uazman Alam and Alena Shantsila and Wahbi El-Bouri and Gregory Y. H. Lip and Yalin Zheng},
journal= {arXiv preprint arXiv:2510.04281},
year = {2025}
}
备注
9 pages, 4 figures, 3 table. Equal contribution: Zhuangzhi Gao and Hongyi Qin. Corresponding author: Yalin Zheng ([email protected])