中文

TRIALSCOPE:用于规模化生成真实世界证据的生物医学语言模型统一因果框架

机器学习 2025-08-19 v3 人工智能 统计方法学

摘要

真实世界数据的快速数字化为优化医疗服务和加速生物医学发现提供了前所未有的机遇。然而,这些数据通常以非结构化形式存在,例如电子病历(EMRs)中的临床笔记,并且通常受混杂因素困扰,使得生成稳健的真实世界证据(RWE)具有挑战性。因此,我们提出 TRIALSCOPE,一个旨在从人群水平观测数据中规模化提炼 RWE 的框架。TRIALSCOPE 利用生物医学语言模型规模化结构化临床文本,采用先进的概率建模进行去噪和插补,并整合最先进的因果推断技术以解决治疗效应估计中的常见混杂因素。我们在来自美国单一大型医疗网络、超过一百万癌症患者的大规模数据集上进行了广泛实验。结果表明,TRIALSCOPE 能自动整理高质量结构化患者数据,扩展数据集并纳入仅以非结构化形式存在的关键患者属性。该框架减少了治疗效应估计中的混杂,生成了与随机对照肺癌试验相当的结果。此外,我们展示了未实施临床试验的模拟——包括一项具有不同合格标准的胰腺癌试验——使用一套验证测试以确保稳健性。我们进行了彻底的消融研究以更好地理解 TRIALSCOPE 的关键组件,并确立从 EMR 生成 RWE 的最佳实践。TRIALSCOPE 能够提取 EMR 中的癌症治疗数据,克服了人工整理的局限。我们还表明 TRIALSCOPE 能从提取的真实世界数据复现肺癌和胰腺癌临床试验的结果。

关键词

引用

@article{arxiv.2311.01301,
  title  = {TRIALSCOPE: A Unifying Causal Framework for Scaling Real-World Evidence Generation with Biomedical Language Models},
  author = {Javier González and Risa Ueno and Cliff Wong and Zelalem Gero and Jass Bagga and Isabel Chien and Eduard Oravkin and Emre Kiciman and Aditya Nori and Roshanthi Weerasinghe and Rom S. Leidner and Brian Piening and Tristan Naumann and Carlo Bifulco and Hoifung Poon},
  journal= {arXiv preprint arXiv:2311.01301},
  year   = {2025}
}

备注

4 figures, 1 table