中文

ChatGPT 与 Bard 在检测阿尔茨海默病中的性能评估

计算与语言 2024-02-06 v1 人工智能

摘要

大语言模型(LLMs)在许多领域的应用日益增多。本文评估了三个 LLM 聊天机器人(ChatGPT-3.5、ChatGPT-4 和 Bard)以其当前公开可用的形式,利用源自自发语音录音的文本输入识别阿尔茨海默病(AD)和认知正常(CN)个体的能力。在两个独立的查询层级上使用了零样本学习方法,其中第二次查询(思维链提示)比第一次引出了更详细的信息。每个 LLM 聊天机器人的性能均根据其生成预测的准确率、灵敏度、特异度、精确率和 F1 分数进行评估。LLM 聊天机器人生成三类结果("AD"、"CN" 或 "不确定")。在阳性识别 AD 时,Bard 产生了最高的真阳性率(89% 召回率)和最高的 F1 分数(71%),但倾向于将 CN 误判为 AD,且置信度较高("不确定"率低);在阳性识别 CN 时,GPT-4 取得了 56% 的最高真阴性率和最高的 F1 分数(62%),采取了审慎立场("不确定"率适中)。总体而言,三个 LLM 聊天机器人识别 AD 与 CN 的表现均超越了随机水平,但目前尚不能满足临床应用要求。

关键词

引用

@article{arxiv.2402.01751,
  title  = {Performance Assessment of ChatGPT vs Bard in Detecting Alzheimer's Dementia},
  author = {Balamurali B T and Jer-Ming Chen},
  journal= {arXiv preprint arXiv:2402.01751},
  year   = {2024}
}

备注

22 pages