对 LLM 医学知识掌握程度的可靠与多样化评估
计算与语言
2024-10-03 v2 人工智能
摘要
掌握医学知识对于医学专用 LLM 至关重要。然而,尽管已有 MedQA 等医学基准,仍然缺乏一个充分利用现有知识库来评估 LLM 医学知识掌握程度的统一框架。在本研究中,我们提出了一个新颖的框架 PretexEval,能够动态生成可靠且多样化的测试样本,以针对任意给定的医学知识库评估 LLM。我们注意到,通过模板或 LLM 直接从知识库生成的测试样本可能会引入事实错误,且缺乏多样性。为解决这些问题,我们在提出的评估框架中引入了一种新颖的模式,采用谓词等价变换为任意给定的医学知识点生成一系列变体。最后,这些生成的谓词变体被转换为文本语言,产生一系列可靠且多样化的测试样本,用于评估 LLM 是否完全掌握了给定的医学事实知识点。在此,我们使用提出的框架,基于两个对临床诊疗至关重要的知识库,系统地研究了 12 个知名 LLM 对医学事实知识的掌握程度。评估结果表明,尽管当前 LLM 在一些著名的公开基准上取得了相当大的成功,但在完全掌握医学知识方面仍存在显著不足。这些新发现为开发医学专用 LLM 提供了有价值的见解,强调当前 LLM 在应用于真实医疗场景之前,迫切需要加强其对医学知识的全面深入掌握。
引用
@article{arxiv.2409.14302,
title = {Reliable and diverse evaluation of LLM medical knowledge mastery},
author = {Yuxuan Zhou and Xien Liu and Chen Ning and Xiao Zhang and Ji Wu},
journal= {arXiv preprint arXiv:2409.14302},
year = {2024}
}
备注
20 pages, 11 figures