急诊室决策支持用的小型语言模型:基准研究
计算与语言
2025-10-07 v1 人工智能
摘要
大型语言模型(LLM)因其日益流行的地位,在医疗领域帮助医生处理各种临床和运营任务。鉴于急诊室(ED)快速而高风险的环境,小型语言模型(SLM)因其参数数量较少于 LLM,具备显著潜力,其固有的推理能力和高效性能使其能够为医生提供及时准确的信息综合,从而改善临床决策和工作流程效率。本文提出一个综合基准,旨在识别适用于 ED 决策支持的 SLM,同时考虑专业医学专业知识和广泛的通用问题解决能力。我们的评估聚焦于训练于通用领域和医学语料混合的 SLM。强调 SLM 的关键动机在于实际硬件限制、运营成本约束以及典型实际部署中的隐私 concerns。我们的基准数据集包括 MedMCQA、MedQA-4Options 和 PubMedQA,其中医学摘要数据集模拟了与实际 ED 医生日常任务相符的任务。实验结果显示,通用领域的 SLM 在这些多样化基准中出类拔萃,超过其医学微调后继者。这表明对于 ED 来说,针对模型的专业医学微调可能并非必需。
引用
@article{arxiv.2510.04032,
title = {Small Language Models for Emergency Departments Decision Support: A Benchmark Study},
author = {Zirui Wang and Jiajun Wu and Braden Teitge and Jessalyn Holodinsky and Steve Drew},
journal= {arXiv preprint arXiv:2510.04032},
year = {2025}
}
备注
Accepted to 2025 IEEE International Conference on Autonomous and Trusted Computing (ATC 2025)