中文

基于环境约束的大语言模型用于电子健康记录数据可靠策展

数据库 2026-02-13 v2 机器学习 应用统计

摘要

电子健康记录 (EHR) 是现代医疗和科研的核心;然而,许多研究人员缺乏数据库专业知识,难以编写复杂的 SQL 查询或生成有效的可视化,从而限制了高效的数据利用和科学发现。为此,我们引入了 CELEC,一个由大语言模型 (LLM) 提供动力的框架,用于自动化 EHR 数据提取和分析。CELEC 通过整合模式信息、零样本演示和链式思考推理的提示策略,将自然语言查询翻译为 SQL,这些策略共同提高了准确性和鲁棒性。CELEC 还遵循严格的隐私协议:LLM 仅访问数据库元数据(如表和列名),而所有查询执行均在机构环境中安全进行,确保患者级别的数据永远不会传输给或与 LLM 共享。在 EHRSQL 数据集的一个子集上,CELEC 在执行准确性方面相当于先前系统,同时保持低延迟、成本效益和严格隐私,仅暴露数据库元数据给 LLM。消融研究确认了 SQL 生成管道的每个组件,特别是零样本演示,在性能中的关键作用。通过降低技术障碍,使医学研究人员能够直接查询 EHR 数据库,CELEC 简化了研究工作流程,加速了生物医学发现。

关键词

引用

@article{arxiv.2511.00772,
  title  = {Reliable Curation of EHR Dataset via Large Language Models under Environmental Constraints},
  author = {Raymond M. Xiong and Panyu Chen and Tianze Dong and Jian Lu and Louis Hu and Nathan Yu and Benjamin Goldstein and Danyang Zhuo and Anru R. Zhang},
  journal= {arXiv preprint arXiv:2511.00772},
  year   = {2026}
}