中文

MedCase-Structured:用于在临床上真实EHR设置下评估诊断推理的文本到FHIR数据集

计算与语言 2026-05-29 v1 人工智能

摘要

大型语言模型(LLM)在临床推理和决策支持方面显示出前景,但在符合现实电子健康记录(EHR)格式的评估方面仍受限。现有基准常依赖静态数据集或非结构化输入,未能反映临床系统中使用的结构化、可互操作的数据格式。我们提出一种管道,用于从非结构化文本生成符合临床规范的HL7 FHIR R4 捆绑包,实现可控的临床决策支持系统评估。该管道结合了分阶段LLM生成、术语导向的验证与修复,以减少幻觉代码并确保结构和语义一致性。将此方法应用于MedCaseReasoning,我们构建MedCase-Structured,合成数据集与临床医生撰写的诊断案例相吻合,实现82.5%的FHIR生成有效性。在MedCase-Structured上的评估显示,LLM在结构化FHIR输入上的诊断准确率持续低于纯文本输入,凸显了部署对齐评估的重要性。

关键词

引用

@article{arxiv.2605.30295,
  title  = {MedCase-Structured: A Text-to-FHIR Dataset for Benchmarking Diagnostic Reasoning in Clinically Realistic EHR Settings},
  author = {Valentina Bui Muti and Eugénie Dulout and Ziquan Fu},
  journal= {arXiv preprint arXiv:2605.30295},
  year   = {2026}
}

备注

Accepted to ICML 2026 Structured Data for Health Workshop