评估大型语言模型在糖尿病视网膜病变和青光眼筛查中的多模态模拟决策能力
计算与语言
2025-07-03 v1
摘要
大型语言模型(LLM)可以基于自然语言提示模拟临床推理,但其在眼科领域的实用性尚未得到广泛探索。本研究评估了 GPT-4 解读结构化眼底照片文本描述并模拟糖尿病视网膜病变(DR)和青光眼筛查临床决策的能力,包括添加真实或合成临床元数据的影响。我们进行了一项使用 300 张标注眼底图像的回顾性诊断验证研究。GPT-4 接收描述每张图像的结构化提示,带或不带患者元数据。该模型被要求为 DR 分级分配 ICDR 严重程度分数、推荐 DR referral 以及估计青光眼 referral 的 cup-to-disc 比。性能通过准确率、宏平均分、加权 F1 分数和 Cohen's kappa 进行评估。使用 McNemar 检验和 change rate 分析评估元数据的影响。GPT-4 在 ICDR 分类中表现中等(准确率 67.5%,宏 F1 0.33,加权 F1 0.67,kappa 0.25),主要是正确识别正常案例。二元 DR referral 任务中表现得到改善(准确率 82.3%,F1 0.54,kappa 0.44)。对于青光眼 referral,所有设置下的表现都很差(准确率约 78%,F1 <0.04,kappa <0.03)。元数据包含情况对结果影响不大(McNemar p > 0.05),且预测在不同条件下保持一致。GPT-4 可以从结构化提示中模拟基本的眼科决策,但缺乏处理复杂任务的精度。虽然不适合临床使用,但 LLM 可能有助于教育、文档或眼科图像标注工作流程。
引用
@article{arxiv.2507.01278,
title = {Evaluating Large Language Models for Multimodal Simulated Ophthalmic Decision-Making in Diabetic Retinopathy and Glaucoma Screening},
author = {Cindy Lie Tabuse and David Restepo and Carolina Gracitelli and Fernando Korn Malerbi and Caio Regatieri and Luis Filipe Nakayama},
journal= {arXiv preprint arXiv:2507.01278},
year = {2025}
}