序列化策略决定影响:FHIR 数据格式对 LLM 药物核对的影响
摘要
临床转接处的药物核对是一项高风险且易出错的任务。大型语言模型日益被提议用于使用 FHIR 结构化患者记录协助完成此任务,但一个基本且鲜有人研究的变量是 FHIR 数据在传递给模型前的序列化方式。我们系统性地比较了四种 FHIR 序列化策略(Raw JSON、Markdown 表格、临床叙述和时间顺序时间线)在五个开源权重模型(Phi-3.5-mini、Mistral-7B、BioMistral-7B、Llama-3.1-8B、Llama-3.3-70B)上的表现,这些模型在 200 名合成患者的受控基准测试中共计进行了 4000 次推理。我们发现,序列化策略对参数量达 80 亿的模型影响巨大且具有统计显著性:Clinical Narrative 相较于 Raw JSON 在 Mistral-7B 上提升最高可达 19 分的 F1 分数(r = 0.617, p < 10^{-10})。在 70B 参数规模时,Raw JSON 的平均 F1 分数达到 0.9956,获得最佳性能。在所有 20 种模型与策略组合中,平均精确率均高于平均召回率:漏检是主要的失败模式,模型更倾向于遗漏一种活跃药物而非虚构一种,这改变了临床安全审计优先级的设置方式。较小的模型在大约 7-10 种活跃药物时达到平台期,为系统性遗漏高风险的多药物患者。BioMistral-7B 这种基于域预训练且未进行指令微调的模型在所有条件下均产生零可用输出,表明仅靠域预训练对于结构化抽取并不充分。这些结果为临床 LLM 部署提供了实用的、基于证据的格式建议:针对 8B 及以下模型使用 Clinical Narrative,针对 70B 及以上模型使用 Raw JSON。完整的管道可在运行于 AWS g6e.xlarge 实例(NVIDIA L40S,48 GB VRAM)上的开源工具中复现。
引用
@article{arxiv.2604.21075,
title = {Performance of the LHCb muon detector in Run 3},
author = {P. Albicocco and M. Anelli and F. Archilli and M. Atzeni and W. Baldini and A. Balla and S. Belin and N. Bondar and D. Brundu and S. Cadeddu and S. Calì and A. Cardini and M. Carletti and A. Casais Vidal and V. Chulikov and A. Chubykin and P. Ciambrone and L. Congedo and A. Contu and F. Debernardis and E. De Lucia and G. De Robertis and M. De Serio and P. De Simone and F. Dettori and L. Dreyfus and A. Dzyuba and G. Felici and M. Gatta and A. Granik and G. Graziani and D. Ilin and S. Kotriakhova and R. Kristic and A. Lai and R. Litvinov and G. Manca and F. Manganella and S. Mariani and G. Martellotti and E. Minucci and R. Oldeman and M. Palutan and L. Paolucci and G. Passaleva and A. Pastore and D. Pinci and R. Quagliani and T. Rong and R. Santacesaria and M. Santimaria and E. Santovetti and A. Saputi and C. Satriano and A. Satta and B. Sciascia and B. Schmidt and T. Schneider and S. Simone and J. Swallow and R. Vazquez Gomez and S. Vecchi and C. Y. Yu and S. Zhang},
journal= {arXiv preprint arXiv:2604.21075},
year = {2026}
}