中文

基于模式引导的大语言模型提取方法用于FHIR患者数字孪生

计算与语言 2026-05-26 v2

摘要

我们重新审视了从非结构化电子健康记录(EHR)构建可互操作患者数字孪生的问题,并认为该任务更适合被定义为受约束的有效FHIR包生成,而非一系列提取模块的级联。我们提出了SG-LLM,一种基于模式引导的大语言模型提取器,它(i)通过SapBERT索引检索候选SNOMED-CT、RxNorm和LOINC代码来增强提示,(ii)在直接源自FHIR R4 StructureDefinitions的JSON Schema下进行解码,以及(iii)闭合一个验证器在环修复阶段,其诊断信息以结构化错误消息的形式反馈。我们认为,评估的正确对象应是数字孪生的实用性,而不仅仅是片段级别的F1分数,并通过一项临床效用实验来操作化这一观点,该实验测量了在SG-LLM生成的FHIR包与专家整理的FHIR包上训练的分类器在30天再入院AUROC上的差距。在MIMIC-IV和n2c2 2018 Track 2基准测试上,SG-LLM匹配或超越了强大的联合提取和普通大语言模型基线,同时生成了实质上更有效的包。消融实验分离了检索、模式约束和修复循环的贡献。所有代码、提示和模式均已发布。

关键词

引用

@article{arxiv.2601.05847,
  title  = {Schema-Grounded LLM Extraction for FHIR Patient Digital Twins},
  author = {Rafael Brens and Yuqiao Meng and Luoxi Tang and Zhaohan Xi},
  journal= {arXiv preprint arXiv:2601.05847},
  year   = {2026}
}