MedConceptsQA:面向医学概念问答的开源基准数据集
计算与语言
2024-05-15 v2 机器学习
摘要
我们提出 MedConceptsQA,这是一个专为医学概念问答设计的开源基准数据集。该基准包含来自不同医学词汇表(包括诊断、程序和药物)的各种医学概念问题。这些问题按难度分为易、中、难三个等级。我们使用多种大型语言模型对该基准进行了评估。我们的发现表明,虽然临床大型语言模型在医学数据上进行过预训练,但在本基准上达到的准确率接近随机猜测。然而,GPT-4 在零样本学习和少样本学习方分别比临床大型语言模型提升了近 27%-37%。我们的基准是评估大型语言模型理解和推理医学概念的宝贵资源。该基准现已发布于 https://huggingface.co/datasets/ofir408/MedConceptsQA
引用
@article{arxiv.2405.07348,
title = {MedConceptsQA: Open Source Medical Concepts QA Benchmark},
author = {Ofir Ben Shoham and Nadav Rappoport},
journal= {arXiv preprint arXiv:2405.07348},
year = {2024}
}