中文

FHIRPath-QA:针对 FHIR 电子健康记录的可执行问答

计算与语言 2026-03-26 v2

摘要

尽管患者日益获得对其电子健康记录(EHR)的数字访问权限,但现有接口可能不支持针对特定患者提出的精确、可靠的问题。大型语言模型(LLM)在临床问答(QA)方面显示出前景,但基于检索的方法计算效率低下、容易产生幻觉且难以部署在真实 EHR 上。本工作引入 FHIRPath-QA,首个针对患者特定问答的开放数据集和基准,包含针对真实临床数据的 FHIRPath 查询。提出一种文本到 FHIRPath 的问答范式,将推理从自由文本生成转向 FHIRPath 查询合成。对于 o4-mini,平均 token 使用量相较于检索优先提示降低了 391 倍(629,829 与 1,609 token/问题),将失败率从 0.36 降至 0.09。该数据集基于 MIMIC-IV on FHIR Demo,包含超过 14k 个自然语言问题(患者和医生措辞),配有验证的 FHIRPath 查询和答案。经实验验证,所评估的 LLM 最多达到 42% 的准确率,凸显该任务的挑战性,但通过监督微调,查询合成准确率显著提升:4o-mini 从 27% 提升至 79%。这些结果表明,文本到 FHIRPath 合成有望作为安全、高效且可互操作的消费者健康应用的实用基础,FHIRPath-QA 数据集和基准为后续研究提供了起点。完整数据集和生成代码可在:https://github.com/mooshifrew/fhirpath-qa 获取。

关键词

引用

@article{arxiv.2602.23479,
  title  = {FHIRPath-QA: Executable Question Answering over FHIR Electronic Health Records},
  author = {Michael Frew and Nishit Bheda and Bryan Tripp},
  journal= {arXiv preprint arXiv:2602.23479},
  year   = {2026}
}

备注

Accepted to LREC 2026 CL4Health Workshop