评估 LLM 在中国药师考试中的表现
人工智能
2025-11-26 v1
摘要
背景:随着大型语言模型(LLM)越来越多地融入数字健康教育和评估工作流程,其在支持高风险、领域特定认证任务方面的能力尚未得到充分探索。在中国,国家药师执业资格考试是评估药师临床和理论能力的标准基准。目标:本研究旨在比较两种 LLM:ChatGPT-4o 与 DeepSeek-R1 在真实考试题目(2017-2021 年)中的表现,并探讨这些表现差异对 AI 辅助形式化评估的意义。方法:编译了 2306 题多选(纯文本)题目,来源于官方考试、培训材料和公开数据库。排除包含表格或图像的题目。每道题以原始中文格式输入,评估模型响应的准确性。采用 Pearson 卡方检验比较整体表现,采用 Fisher 精确检验进行年份逐项的多选准确率分析。结果:DeepSeek-R1 在整体准确率上显著高于 ChatGPT-4o(90.0% vs. 76.1%,p < 0.001)。单元层面的分析揭示,DeepSeek-R1 在基础和临床综合模块中始终具有优势。虽然按年份的多选表现也偏向 DeepSeek-R1,但在任何具体年份的单元中,性能差距均未达到统计显著性(所有 p > 0.05)。结论:DeepSeek-R1 在结构和语义上与药师执业资格考试的要求高度吻合。这一发现表明,特定领域模型在此背景下值得进一步调查,同时也强化了在法律和伦理敏感情境中人类监督的必要性。
引用
@article{arxiv.2511.20526,
title = {Assessing LLMs' Performance: Insights from the Chinese Pharmacist Exam},
author = {Xinran Wang and Boran Zhu and Shujuan Zhou and Ziwen Long and Dehua Zhou and Shu Zhang},
journal= {arXiv preprint arXiv:2511.20526},
year = {2025}
}
备注
15 pages, 4 figures