评估大语言模型基于医学图像与症状分析生成的多模态诊断
计算与语言
2024-02-07 v1 人工智能
计算机视觉与模式识别
摘要
大语言模型(LLM)构成了一项突破性的最先进人工智能技术,其发展迅速,有望辅助医学诊断。然而,其返回结果的正确性与准确性尚未得到恰当评估。在本工作中,我们提出了一种包含两个独立步骤的新型 LLM 评估范式:(1) 通过结构化交互进行多模态 LLM 评估,以及 (2) 基于先前交互提取的数据进行后续的领域特定分析。利用该范式,(1) 我们使用病理学领域公开可用的多模态多项选择题(MCQs)评估了 LLM 生成医学诊断的正确性与准确性,(2) 进而对提取的结果进行了系统且全面的分析。我们使用 GPT-4-Vision-Preview 作为 LLM 来回答包含图像和文本的复杂医学问题,并探索了病理学庞大知识域中包含的广泛疾病、状况、化合物及相关实体类型。GPT-4-Vision-Preview 表现相当出色,正确诊断率约为 84%。接下来,我们采用一种分析方法进一步分析了研究结果,该方法包括图像元数据分析、命名实体识别和知识图谱。研究揭示了 GPT-4-Vision-Preview 在特定知识路径上的弱点,从而加深了对其在特定领域 shortcomings 的理解。我们的方法和发现不仅限于使用 GPT-4-Vision-Preview,类似的方法也可用于评估其他 LLM 的有用性和准确性,从而通过进一步优化改进其使用。
引用
@article{arxiv.2402.01730,
title = {Evaluating LLM -- Generated Multimodal Diagnosis from Medical Images and Symptom Analysis},
author = {Dimitrios P. Panagoulias and Maria Virvou and George A. Tsihrintzis},
journal= {arXiv preprint arXiv:2402.01730},
year = {2024}
}
备注
Department of Informatics, University of Piraeus, Greece