MultifacetEval:探索大语言模型掌握医学知识的多维度评估
计算与语言
2024-06-06 v1
摘要
大语言模型(Large Language Models, LLMs)在多个领域均取得优异成绩,尤其在医学评估基准(如MedQA)上表现突出。然而,报告的性能与实际应用中的效果之间仍存显著差距。本文通过构建多维度检验框架,系统探究当前LLMs掌握医学知识的实际程度。具体而言,我们开发了新的评估框架MultifacetEval,以同时检验LLMs在编码和掌握医学知识的多个维度(比较、纠正、判别和验证)。基于MultifacetEval框架,我们构建了两个多维度评估数据集:MultiDiseK(从临床疾病知识库生成问题)和MultiMedQA(将医学基准MedQA中的问题改写为多维度问题)。在这些多维度数据集上的实验结果表明,当前LLMs掌握医学知识的程度远低于在现有医学基准上的表现,表明其在医学知识掌握方面缺乏深度、精确性和全面性。因此,当前LLMs尚未准备好在实际医疗任务中应用。代码和数据集已公开于https://github.com/THUMLP/MultifacetEval。
关键词
引用
@article{arxiv.2406.02919,
title = {MultifacetEval: Multifaceted Evaluation to Probe LLMs in Mastering Medical Knowledge},
author = {Yuxuan Zhou and Xien Liu and Chen Ning and Ji Wu},
journal= {arXiv preprint arXiv:2406.02919},
year = {2024}
}
备注
Accepted by IJCAI 2024