中文

FeatEHR-LLM:利用大语言模型进行电子健康记录特征工程

机器学习 2026-04-27 v1 人工智能

摘要

电子健康记录(EHR)的特征工程受到不规则观测间隔、可变测量频率以及临床时间序列固有的结构稀疏性的复杂性制约。现有的自动方法要么缺乏临床领域意识,要么假设干净、规则采样的输入,限制了其在真实世界 EHR 数据中的适用性。我们提出 FeatEHR-LLM 框架,利用大语言模型(LLM)从不规则采样的 EHR 时间序列生成临床上有意义的表格特征。为限制患者隐私暴露,LLM 仅 operates on 数据集模式和任务描述,而非原始患者记录。一种带工具的生成机制为 LLM 提供了针对不规则时间数据查询的专用例程,使其能够生成可执行的特征提取代码,显式处理不规则观测模式和信息稀疏性。FeatEHR-LLM 支持单变量和多变量特征生成,通过迭代、在验证环节中进行的管道实现。我们在四个 ICU 数据集上的八个临床预测任务中评估了该框架,结果表明,该框架在 7 个任务中实现了最高的平均 AUROC,优于强基准模型,可提升最高达 6 个百分点。代码已公开于 github.com/hojjatkarami/FeatEHR-LLM。

关键词

引用

@article{arxiv.2604.22534,
  title  = {FeatEHR-LLM: Leveraging Large Language Models for Feature Engineering in Electronic Health Records},
  author = {Hojjat Karami and David Atienza and Jean-Philippe Thiran and Anisoara Ionescu},
  journal= {arXiv preprint arXiv:2604.22534},
  year   = {2026}
}