中文

临床文本到SQL中的患者相似性队列推理

计算与语言 2026-01-16 v1

摘要

现实世界的临床文本到SQL(text-to-SQL)需要对异构的电子健康记录(EHR)表、时间窗口和患者相似性队列进行推理,以生成可执行的查询。我们引入了CLINSQL,这是一个基于MIMIC-IV v3.1的基准测试,包含633个专家标注的任务,要求进行多表连接、临床上有意义的过滤,并生成可执行的SQL。解决CLINSQL任务需要导航模式元数据和临床编码系统,处理长上下文,并组合超出传统文本到SQL范围的多步查询。我们评估了22个专有和开源模型,采用思维链(Chain-of-Thought)自我优化方法,并使用基于评分标准的SQL分析,结合优先考虑关键临床需求的执行检查。尽管近期取得了进展,但性能仍远未达到临床可靠性:在测试集上,GPT-5-mini的执行得分为74.7%,DeepSeek-R1以69.2%领先开源模型,而Gemini-2.5-Pro从简单任务上的85.5%下降到困难任务上的67.2%。在CLINSQL上的进展标志着朝着实现用于现实世界EHR分析的临床可靠文本到SQL迈出了实质性步伐。

关键词

引用

@article{arxiv.2601.09876,
  title  = {Patient-Similarity Cohort Reasoning in Clinical Text-to-SQL},
  author = {Yifei Shen and Yilun Zhao and Justice Ou and Tinglin Huang and Arman Cohan},
  journal= {arXiv preprint arXiv:2601.09876},
  year   = {2026}
}

备注

Accepted by EACL 2026