中文

轻量级开源大语言模型在儿科咨询中的性能评估:比较分析

机器学习 2024-07-24 v1 人工智能 计算与语言 计算机与社会

摘要

大语言模型(LLM)在医疗领域展现出潜在应用前景,但数据隐私与计算负担限制了其在医疗机构的部署。开源且轻量级的 LLM 作为潜在解决方案,但其在儿科场景中的性能仍未得到充分探索。本横断面研究从公开医疗论坛随机抽取 250 条患者咨询问题(每门 25 个儿科科室,时间跨度为2022年12月1日至2023年10月30日),分别由 ChatGLM3-6B、Vicuna-7B、Vicuna-13B 以及广泛使用的专有模型 ChatGPT-3.5 在2023年11月1日至11月7日独立作答(中文)。为评估可重复性,每个问题复制一次。我们发现ChatGLM3-6B 在准确性与完整性方面均优于 Vicuna-13B 与 Vicuna-7B(P < .001),但均被 ChatGPT-3.5 超越。ChatGPT-3.5 在准确性上获得最高评分(65.2%),其次为ChatGLM3-6B(41.2%),Vicuna-13B(11.2%),Vicuna-7B(4.4%)。在完整性方面,ChatGPT-3.5 领先(78.4%),其后为ChatGLM3-6B(76.0%),Vicuna-13B(34.8%),Vicuna-7B(22.0%)。在可读性方面,ChatGLM3-6B 与 ChatGPT-3.5 相当,均优于 Vicuna 模型(P < .001)。在同情心方面,ChatGPT-3.5 在轻量级 LLM 之上(P < .001)。在安全性方面,所有模型表现相当良好(P > .05),且超过 98.4% 的回答被评定为安全。询问的重复确认了这些发现。结论表明,轻量级 LLM 在儿科医疗保健中展现出有前景的应用潜力。然而,轻量级模型与大规模专有 LLM 之间的差距凸显了需要持续发展努力的必要性。

关键词

引用

@article{arxiv.2407.15862,
  title  = {Performance Evaluation of Lightweight Open-source Large Language Models in Pediatric Consultations: A Comparative Analysis},
  author = {Qiuhong Wei and Ying Cui and Mengwei Ding and Yanqin Wang and Lingling Xiang and Zhengxiong Yao and Ceran Chen and Ying Long and Zhezhen Jin and Ximing Xu},
  journal= {arXiv preprint arXiv:2407.15862},
  year   = {2024}
}

备注

27 pages in total with 17 pages of main manuscript and 10 pages of supplementary materials; 4 figures in the main manuscript and 2 figures in supplementary material