开源大语言模型、GPT-4与Claude 2的比较研究:肾脏病学中的多选题测试表现
计算与语言
2023-08-10 v1
摘要
近年来,自然语言处理领域取得了显著突破,尤其是大语言模型(LLMs)的发展。这些LLM在各种基准上展现了卓越能力。在医疗领域,LLM及其他未来AI模型的确切角色仍不明确。这些模型未来有可能被用于自适应医师培训、医疗副驾驶应用以及数字化患者交互场景。AI模型参与医学培训与患者照护的能力,部分取决于其对特定医学领域知识内容的掌握。本研究考察了LLM的医学知识能力,具体针对内科亚专科多选题作答能力。我们将若干开源LLM(Koala 7B、Falcon 7B、Stable-Vicuna 13B和Orca Mini 13B)与GPT-4和Claude 2在肾脏病学领域多选题上的表现进行比较。肾脏病学被选作内科中概念尤为复杂的亚专科领域的示例。本研究旨在评估LLM模型对nephSAP(肾脏病学自我评估项目)多选题给出正确答案的能力。开源LLM在回答858道nephSAP多选题时的总体正确率为17.1%–25.5%。相比之下,Claude 2答对了54.4%的题目,而GPT-4得分达73.3%。我们表明,与GPT-4和Claude 2相比,当前广泛使用的开源LLM在零样本推理能力上表现很差。本研究的发现对未来亚专科医学培训与患者照护具有潜在重要意义。
引用
@article{arxiv.2308.04709,
title = {A Comparative Study of Open-Source Large Language Models, GPT-4 and Claude 2: Multiple-Choice Test Taking in Nephrology},
author = {Sean Wu and Michael Koo and Lesley Blum and Andy Black and Liyo Kao and Fabien Scalzo and Ira Kurtz},
journal= {arXiv preprint arXiv:2308.04709},
year = {2023}
}
备注
7 pages, 3 figures, 1 table