中文

多认知层次评估大语言模型:从医学知识掌握到情景式问题解决

计算与语言 2025-06-11 v1 人工智能

摘要

大语言模型(LLMs)在 various 医学基准测试中展现出惊人的性能,但其在不同认知层次上的能力仍未得到充分探索。本文灵感来源于布鲁姆分类学,提出一种用于评估大语言模型在医学领域中多认知层次能力的框架。该框架整合现有医学数据集,引入针对三个认知层次的任务:初级知识掌握、综合知识应用和情景式问题解决。使用该框架,我们系统评估了来自六大主流家族的领先通用和医学大语言模型:Llama、Qwen、Gemma、Phi、GPT 和 DeepSeek。我们的发现表明,随着认知复杂度的提升,所评估模型的性能呈现显著下降,而模型规模在高认知层次上的表现作用更大。我们的研究凸显了提升大语言模型在高认知层次医学能力的必要性,并为开发适用于实际医学应用的大语言模型提供了洞见。

关键词

引用

@article{arxiv.2506.08349,
  title  = {Evaluating LLMs Across Multi-Cognitive Levels: From Medical Knowledge Mastery to Scenario-Based Problem Solving},
  author = {Yuxuan Zhou and Xien Liu and Chenwei Yan and Chen Ning and Xiao Zhang and Boxun Li and Xiangling Fu and Shijin Wang and Guoping Hu and Yu Wang and Ji Wu},
  journal= {arXiv preprint arXiv:2506.08349},
  year   = {2025}
}

备注

20 pages, 11 figures. Accepted by ICML 2025