利用多智能体语言模型从临床笔记中规模化生成临床级特征
人工智能
2025-12-30 v2 机器学习
多智能体系统
摘要
开发准确的临床预测模型通常受限于从非结构化电子健康记录笔记中推导有意义的结构化特征的困难,这一过程传统上需要手动、不可扩展的临床抽象。在本研究中,我们首先建立了一个严格的患者级临床特征生成协议,其中领域专家手动审阅笔记,为147名前列腺癌患者队列定义并提取细微特征。作为高保真度的真实数据,这一劳动密集型过程为SNOW(可扩展笔记到结果工作流)提供了蓝图,SNOW是一个透明的多智能体大语言模型系统,旨在自主模拟临床专家的迭代推理和验证工作流。在5年癌症复发预测中,SNOW(AUC-ROC 0.767)实现了与手动临床特征生成(0.762)相当的性能,并优于结构化基线、临床医生引导的LLM提取以及六种代表性特征生成方法。一旦配置完成,SNOW在5小时临床医生监督下于12小时内生成了完整的患者级特征表,与手动临床特征生成相比,将人类专家工作量减少了约48倍。为了在手动临床特征生成不可行的情况下测试可扩展性,我们将SNOW部署在来自MIMIC-IV(n=2,084)的外部射血分数保留的心力衰竭队列上;无需任务特定调整,SNOW生成的预后特征在30天(SNOW: 0.851)和1年(SNOW: 0.763)死亡率预测中优于基线和代表性特征生成方法。这些结果表明,一个模块化的LLM智能体系统可以从临床笔记中规模化生成专家级特征,同时在结果预测中实现对非结构化电子健康记录文本的可解释使用,并在各种环境和条件下保持泛化能力。
引用
@article{arxiv.2508.01956,
title = {Scaling Clinician-Grade Feature Generation from Clinical Notes with Multi-Agent Language Models},
author = {Jiayi Wang and Jacqueline Jil Vallon and Nikhil V. Kotha and Neil Panjwani and Xi Ling and Margaret Redfield and Sushmita Vij and Sandy Srinivas and John Leppert and Mark K. Buyyounouski and Mohsen Bayati},
journal= {arXiv preprint arXiv:2508.01956},
year = {2025}
}