中文

利用大语言模型分类患者吸烟状态来控制未观测混杂因素

机器学习 2024-11-06 v1 人工智能

摘要

因果理解是基于循证医学的基本目标。当随机化不可行时,因果推断方法允许从观察性数据的回顾性分析中估计治疗效果。然而,此类分析依赖于若干假设,通常包括无未观测混杂因素的假设。在许多实际场景中,当重要变量未在临床记录中明确测量时,该假设被违反。先前的研究提出通过机器学习方法处理未观测混杂因素,即对未观测变量进行插补,然后纠正分类器的测量误差。当可以训练此类分类器且满足必要假设时,该方法可以恢复因果效应的无偏估计。然而,此类工作仅限于合成数据、简单分类器和二元变量。本文通过使用在临床笔记上训练的大语言模型来预测患者的吸烟状态(否则将是一个未观测混杂因素),扩展了该方法论。然后,我们对分类预测的吸烟状态应用测量误差校正,以估计MIMIC数据集中经胸超声心动图对死亡率的因果效应。

关键词

引用

@article{arxiv.2411.03004,
  title  = {Controlling for Unobserved Confounding with Large Language Model Classification of Patient Smoking Status},
  author = {Samuel Lee and Zach Wood-Doughty},
  journal= {arXiv preprint arXiv:2411.03004},
  year   = {2024}
}

备注

Advancements In Medical Foundation Models: Explainability, Robustness, Security, and Beyond (AIM-FM) at NeurIPS 2024