使用多模态大语言模型模拟临床AI辅助:糖尿病视网膜病例研究
人工智能
2025-09-17 v1 计算机视觉与模式识别
人机交互
摘要
糖尿病视网膜(DR)是全球失明的主要原因,AI系统可以扩大视网膜摄影筛查的可及性。当前获FDA批准的系统主要提供二元 referrals 输出,这一最小化输出可能限制了临床信任和实用性。然而,确定最有效的输出格式以增强临床医生与AI的绩效是一个难以在大规模范围内评估的经验性挑战。我们评估了多模态大语言模型(MLLM)用于DR检测及其在不同输出类型下的模拟临床AI辅助能力。测试了两个模型:GPT-4o,这是一个通用型MLLM,和MedGemma,这是一个开源医疗模型。实验包括:(1)基线评估,(2)使用合成预测的模拟AI辅助,以及(3)实际的AI到AI协作,其中GPT-4o整合了MedGemma的输出。MedGemma在基线测试中优于GPT-4o,实现了更高的灵敏度和AUROC,而GPT-4o显示接近完美的特异度但灵敏度较低。两个模型都根据模拟的AI输入调整了预测,但GPT-4o在错误输入下性能恶化,而MedGemma保持更稳定。在实际协作中,GPT-4o在MedGemma的描述性输出指导下取得了强烈的结果,即使没有直接访问图像也能做到(AUROC最高可达0.96)。这些发现表明,MLLM可能改善DR筛查管道,并作为可扩展的模拟器来研究临床AI辅助在不同输出配置下的表现。开放且轻量级的模型如MedGemma在资源有限的setting中尤其有价值,而描述性输出可能增强临床工作流程中的可解释性和临床医生信任。
引用
@article{arxiv.2509.13234,
title = {Simulating Clinical AI Assistance using Multimodal LLMs: A Case Study in Diabetic Retinopathy},
author = {Nadim Barakat and William Lotter},
journal= {arXiv preprint arXiv:2509.13234},
year = {2025}
}