用于在线患者咨询可操作分诊分类的小样本大语言模型
计算与语言
2026-05-18 v1 机器学习
定量方法
摘要
在线患者咨询通常是非正式的、不完整的,并且在专业评估之前撰写,但仍需将其路由到适当的临床随访级别。我们将其作为一个四类可操作分诊任务进行研究——自我护理、预约就诊、紧急临床审查或急诊转诊,并探讨在低资源标注条件下,提示型大语言模型(LLM)能否支持此类路由。使用公开的 HealthCareMagic-100K 语料库,我们构建了一个包含 300 个样本的人工校准黄金评估集、一个包含 700 个样本的自动标注白银训练集以及一个包含 40 个样本的小样本池。我们将基于白银标签训练的 TF-IDF 和 BioBERT 基线模型与在 0-shot、4-shot 和 12-shot 条件下的六个提示型 LLM 进行比较。相应地,我们使用宏 以及安全感知指标进行评估,包括急诊召回率、分诊不足率和严重分诊不足率。最强的 LLM(Claude Haiku 4.5,12-shot)达到了 0.475 的宏 ,在点估计上超过了最佳监督基线(BioBERT,0.378),但置信区间重叠。小样本提示和双模型一致性以依赖标签的方式提供帮助:自我护理的一致性可靠,而紧急临床审查则不然。我们得出结论,LLM 可以支持分诊优先级排序和选择性人工审查,但不能用于自主部署。
引用
@article{arxiv.2605.15680,
title = {Few-Shot Large Language Models for Actionable Triage Categorization of Online Patient Inquiries},
author = {Liqi Zhou and Jiafu Li},
journal= {arXiv preprint arXiv:2605.15680},
year = {2026}
}
备注
4 figures, 19 tables, 23 pages (including appendix and reference)