在 CMExam 上评测大语言模型——一个综合性的中文医学考试数据集
计算与语言
2023-10-24 v3
摘要
大语言模型(LLMs)的最新进展改变了问答(QA)领域的格局。然而,由于缺少标准化且全面的数据集,在医学领域评测 LLMs 颇具挑战。为弥补这一空白,我们推出了源自中国国家医师资格考试的 CMExam。CMExam 包含 6 万余道多选题,用于标准化和客观化评测,以及以开放式方式评测模型推理能力的解析说明。为深入分析 LLMs,我们邀请医学专业人员标注了五类额外的题目级注释,包括疾病分组、临床科室、医学学科、胜任力领域以及题目难度等级。除数据集外,我们进一步在 CMExam 上用具有代表性的 LLMs 和 QA 算法进行了充分实验。结果表明,GPT-4 取得了 61.6% 的最佳准确率和 0.617 的加权 F1 分数。这些结果相较于人类 71.6% 的准确率显示出巨大差距。在解析任务中,尽管 LLMs 能够生成相关推理并在微调后表现出性能提升,但仍未达到理想标准,表明尚有较大改进空间。据我们所知,CMExam 是首个提供全面医学注释的中文医学考试数据集。关于 LLM 评测的实验与发现也为构建中文医学 QA 系统和 LLM 评测流程中的挑战与潜在解决方案提供了宝贵见解。数据集与相关代码发布于 https://github.com/williamliujl/CMExam。
引用
@article{arxiv.2306.03030,
title = {Benchmarking Large Language Models on CMExam -- A Comprehensive Chinese Medical Exam Dataset},
author = {Junling Liu and Peilin Zhou and Yining Hua and Dading Chong and Zhongyu Tian and Andrew Liu and Helin Wang and Chenyu You and Zhenhua Guo and Lei Zhu and Michael Lingzhi Li},
journal= {arXiv preprint arXiv:2306.03030},
year = {2023}
}
备注
Accepted by NeurIPS 2023 Datasets and Benchmarks Track