中文

大语言模型在围手术期风险预测与预后判断中的能力

人工智能 2024-01-04 v1 计算与语言

摘要

我们研究通用领域的大语言模型(如 GPT-4 Turbo)能否利用手术描述和源自电子健康记录的患者临床笔记进行风险分层并预测术后结局指标。我们考察了在 8 项不同任务上的预测性能:ASA 体格状态分级预测、住院、ICU 入住、非计划入院、住院死亡率、PACU 第一阶段时长、住院时长和 ICU 时长。少样本和思维链提示提升了几项任务的预测性能。我们在 ASA 体格状态分级上取得了 0.50 的 F1 分数,ICU 入住为 0.81,住院死亡率为 0.86。在所有提示策略下,时长预测任务的性能普遍较差。当前一代大语言模型可以在分类任务上辅助临床医生进行围手术期风险分层,并生成高质量的自然语言摘要和解释。

关键词

引用

@article{arxiv.2401.01620,
  title  = {Large Language Model Capabilities in Perioperative Risk Prediction and Prognostication},
  author = {Philip Chung and Christine T Fong and Andrew M Walters and Nima Aghaeepour and Meliha Yetisgen and Vikas N O'Reilly-Shah},
  journal= {arXiv preprint arXiv:2401.01620},
  year   = {2024}
}