面向临床决策支持的设备内 LLM 基准测试与适配
计算与语言
2026-04-29 v2 人工智能
摘要
大型语言模型(LLM)在临床决策方面取得了快速进展,但专有系统的部署受到隐私顾虑和依赖云端基础设施的限制。开源替代方案允许本地推理,但通常模型规模较大,限制了在资源受限的临床环境中的应用。本文对来自 gpt-oss(20B、120B)、Qwen3.5(9B、27B、35B)和 Gemma 4(31B)家族的设备内 LLM 在三个典型临床任务上的基准测试:一般疾病诊断、专科(眼科)诊断和管理,以及模拟人类专家评分和评估。我们将其性能与最先进的专有模型(GPT-5.1、GPT-5-mini 和 Gemini 3.1 Pro)以及领先的开源模型(DeepSeek-R1)进行比较,并进一步评估了在一般诊断数据上对 gpt-oss-20B 和 Qwen3.5-35B 进行微调的适应性。对于所有任务,设备内模型的性能可与 DeepSeek-R1 或 GPT-5-mini 持平甚至更好,尽管规模显著更小。此外,微调显著提高了诊断准确率,微调后的 Qwen3.5-35B 达到 87.9%,接近专有模型 GPT-5.1 的 89.4%。在基础设备内模型中,Gemma 4 31B 在一般诊断准确率方面最佳,达到 86.5%,超越 GPT-5-mini,接近微调后的 Qwen3.5-35B。错误特征分析显示,所有模型的诊断错误中,有 87.2% 是临床上合理的鉴别诊断,而非偏离主题的预测;上限分析显示通过改进答案选择,准确率可达 93.2%。这些发现表明,设备内 LLM 能够提供准确、可适配且注重隐私的临床决策支持,为将 LLM 更广泛地集成到日常临床实践中提供了可行的路径。
引用
@article{arxiv.2601.03266,
title = {Benchmarking and Adapting On-Device LLMs for Clinical Decision Support},
author = {Alif Munim and Jun Ma and Omar Ibrahim and Alhusain Abdalla and Shuolin Yin and Leo Chen and Bo Wang},
journal= {arXiv preprint arXiv:2601.03266},
year = {2026}
}