中文

在面向儿科内分泌学的小型开源医疗大语言模型中超越准确率的稳定性度量

计算与语言 2026-01-21 v1 人工智能

摘要

小型开源医疗大语言模型(LLM)为低资源部署和更广泛的普及提供了有前景的机遇。然而,对其评估通常局限于医学多选题(MCQ)基准上的准确率,缺乏对一致性、鲁棒性或推理行为的评估。我们使用 MCQ 结合人工评估和临床审查,评估了六款小型开源医疗 LLM(HuatuoGPT-o1 (Chen 2024)、Diabetica-7B、Diabetica-o1 (Wei 2024)、Meditron3-8B (Sallinen2025)、MedFound-7B (Liu 2025) 和 ClinicaGPT-base-zh (Wang 2023))在儿科内分泌学中的表现。在确定性设置下,我们检验了提示词变化对模型输出和自我评估偏差的影响。在随机设置下,我们评估了输出变异性,并研究了一致性与正确性之间的关系。HuatuoGPT-o1-8B 取得了最高性能。结果表明,模型响应间的高一致性并不是正确性的指标,尽管 HuatuoGPT-o1-8B 表现出最高的一致率。在要求选择正确推理时,HuatuoGPT-o1-8B 和 Diabetica-o1 均表现出自我评估偏差以及对候选解释顺序的依赖。对错误推理依据的专家审查发现,其中混杂了临床可接受的反应和临床疏漏。我们进一步表明,系统级扰动(如 CUDA 构建差异)尽管保持准确率稳定,却可导致模型输出发生具有统计学显著性的偏移。本研究表明,微小的、语义上可忽略的提示扰动会导致发散的输出,引发了对基于 LLM 评估的可重复性的担忧,并突出了不同随机机制下的输出变异性,强调需要一个更广泛的诊断框架,以理解现实临床决策支持场景中的潜在陷阱。

关键词

引用

@article{arxiv.2601.11567,
  title  = {Measuring Stability Beyond Accuracy in Small Open-Source Medical Large Language Models for Pediatric Endocrinology},
  author = {Vanessa D'Amario and Randy Daniel and Alessandro Zanetti and Dhruv Edamadaka and Nitya Alaparthy and Joshua Tarkoff},
  journal= {arXiv preprint arXiv:2601.11567},
  year   = {2026}
}

备注

20 pages, 11 figures, accepted at 47 workshop Reproducible Artificial Intelligence (AAAI 2026, Singapore, January 27, 2026)