大语言模型评估精神科功能的能力
计算与语言
2023-08-04 v1 人工智能
机器学习
摘要
当前工作考察了在大型医学知识语料上显式训练的大语言模型(LLM)(Med-PaLM 2)在未经相应训练的情况下,从患者访谈和临床描述中预测精神科功能的能力。为评估此能力,使用提示词分析了 n = 145 份抑郁评估、n = 115 份 PTSD 评估以及 n = 46 份临床案例研究,涵盖高患病率/高共病障碍(抑郁、焦虑、精神病性、创伤与应激、成瘾障碍),以提取估计的临床评分与诊断。结果表明,Med-PaLM 2 能够评估一系列精神科状况下的精神科功能,其中最强表现为基于标准化评估的抑郁评分预测(准确率范围 = 0.80 - 0.84),其在统计上与人类临床评分者无差异 t(1,144) = 1.20;p = 0.23。结果显示了通用临床语言模型基于患者与临床医生对功能的自由描述灵活预测精神科风险的潜力。
引用
@article{arxiv.2308.01834,
title = {The Capability of Large Language Models to Measure Psychiatric Functioning},
author = {Isaac R. Galatzer-Levy and Daniel McDuff and Vivek Natarajan and Alan Karthikesalingam and Matteo Malgaroli},
journal= {arXiv preprint arXiv:2308.01834},
year = {2023}
}