LLM 提取的协变量用于临床因果推断: 重新思考集成策略
机器学习
2026-04-22 v2
摘要
从电子健康记录(EHR)进行因果推断受限于未测量的混杂因素: 如老年痴呆症、治疗目标和心理状态等关键临床状态仅记录在自由文本笔记中, 缺失于结构化数据中。大型语言模型可将这些潜在混杂因素提取为可解释、结构化的协变量, 但如何将其有效集成到因果估计管道中尚未系统研究。我们使用 21,859 例败血症患者的 MIMIC-IV 数据库, 比较七种协变量集成策略, 用于估计早期血管紧张素启动对 28 天死亡率的影响, 包括表格化基线方法、传统 NLP 表示以及三种 LLM 增强方法。核心发现并非所有集成策略都 equally effective: 直接将 LLM 协变量增强到倾向得分模型中可获得最佳性能, 而基于文本派生分类距离的双卡枪匹配会限制捐赠者池并导致估计退化。在半合成实验中, 已知真实效应的情境下, LLM 增强型倾向得分将估计偏差从 0.0143 降至 0.0003, 并在相当程度的模拟提取误差下保持优势。在真实数据上, 纳入 LLM 提取的协变量将治疗效应估计从 0.055 降至 0.027, 与 CLOVERS 随机试验方向一致; 采用双鲁棒估计器得到 0.019, 确认了此发现的稳健性。我们的结果为在关键护理中如何及何时使用文本派生协变量改善因果估计提供了实用指导。
引用
@article{arxiv.2604.16763,
title = {LLM-Extracted Covariates for Clinical Causal Inference: Rethinking Integration Strategies},
author = {Lei Liu and Jialin Chen and Kathy Macropol},
journal= {arXiv preprint arXiv:2604.16763},
year = {2026}
}