大语言模型预测急性脑梗后功能预后
机器学习
2026-02-12 v1 人工智能
计算与语言
计算机与社会
摘要
准确预测急性脑梗后功能预后可为临床决策和资源分配提供依据。先前的修改性准等级制度(mRS)预测研究主要依赖结构化变量(如年龄、NIHSS)和传统机器学习方法。大语言模型(LLM)能否直接从常规入院记录推断未来 mRS 分数尚未得到充分探索。我们评估了编码器(BERT、NYUTron)和生成式模型(Llama-3.1-8B、MedGemma-4B),在冻结和微调设置下,对来自 NYU Langone Get With The Guidelines-Stroke 注册数据库的出院和 90 天 mRS 预测。出院数据集包含 9,485 份病史和体格检查记录,90 天数据集包含 1,898 份记录(2016-2025 年)。数据按时间顺序划分,最近 12 个月用于测试。采用确切(7 分类) mRS 准确率和二分类功能预后( mRS 0-2 vs. 3-6)准确率进行评估,并与纳入 NIHSS 和年龄的既定结构化数据基准进行比较。微调后的 Llama 取得最佳性能,90 天确切 mRS 准确率为 33.9% [95% 置信区间,27.9-39.9%],二分类准确率为 76.3% [95% 置信区间,70.7-81.9%]。出院性能达到 42.0% [95% 置信区间,39.0-45.0%] 确切准确率和 75.0% [95% 置信区间,72.4-77.6%] 二分类准确率。对于 90 天预测,Llama 的表现与结构化数据基准相当。微调后的 LLM可从入院记录alone 预测卒中后功能预后,实现的性能相当于需要结构化变量抽象的模型。我们的发现支持开发无需手动数据抽取即可无缝集成到临床工作流程中的基于文本的预后工具。
引用
@article{arxiv.2602.10119,
title = {Large Language Models Predict Functional Outcomes after Acute Ischemic Stroke},
author = {Anjali K. Kapoor and Anton Alyakin and Jin Vivian Lee and Eunice Yang and Annelene M. Schulze and Krithik Vishwanath and Jinseok Lee and Yindalon Aphinyanaphongs and Howard Riina and Jennifer A. Frontera and Eric Karl Oermann},
journal= {arXiv preprint arXiv:2602.10119},
year = {2026}
}