中文

大型语言模型能否作为合格的儿科医生?在真实临床情境中的系统评估

计算与语言 2025-11-18 v1

摘要

随着大型语言模型(LLM)在医学领域的快速崛起,一个关键问题是它们是否能够在真实临床环境中作为合格的儿科医生发挥作用。我们开发了 PEDIASBench,一个以知识-系统框架为中心,针对真实临床环境而设计的系统评估框架。PEDIASBench 在三个维度上评估 LLM:应用基础知识、动态诊断和治疗能力,以及儿科医学安全与医学伦理。我们评估了过去两年间发布的 12 个代表性模型,包括 GPT-4o、Qwen3-235B-A22B 和 DeepSeek-V3,覆盖 19 个儿科子专科和 211 种原型疾病。领先的模型在基础知识方面表现良好,Qwen3-235B-A22B 在执业考试水平问题上准确率超过 90%,但随着任务复杂度提升,性能下降约 15%,揭示了复杂推理的局限性。多选题评估凸显了整合推理和知识回忆方面的弱点。在动态诊断和治疗情境中,DeepSeek-R1 在案例推理方面得分最高(均值 0.58),但大多数模型在应对真实时间患者变化方面仍感困难。在儿科医学伦理和安全任务上,Qwen2.5-72B 表现最佳(准确率 92.05%),不过人文关怀方面仍有待提升。这些发现表明,儿科 LLM 在动态决策和人文关怀方面受限,未能独立完成儿科护理。但它们在决策支持、医学教育和患者沟通方面具有潜力,为构建一个安全可靠、以人类合作为核心的智能儿科医疗系统奠定了基础。未来发展应聚焦于多模态集成和临床反馈-模型迭代循环,以提升安全性、可解释性和人机协作能力。

关键词

引用

@article{arxiv.2511.13381,
  title  = {Can Large Language Models Function as Qualified Pediatricians? A Systematic Evaluation in Real-World Clinical Contexts},
  author = {Siyu Zhu and Mouxiao Bian and Yue Xie and Yongyu Tang and Zhikang Yu and Tianbin Li and Pengcheng Chen and Bing Han and Jie Xu and Xiaoyan Dong},
  journal= {arXiv preprint arXiv:2511.13381},
  year   = {2025}
}