15 款前沿 AI 聊天机器人的单次急诊精神科分诊
神经元与认知
2026-04-29 v1 人工智能
人机交互
摘要
AI 聊天机器人越来越多地被用于健康咨询,但它们在精神科分诊中的表现仍有待充分表征。精神科分诊尤其具有挑战性,因为紧迫性通常必须从思想、行为和背景中推断,而不是从客观检查结果中得出。我们使用 112 个临床情境评估了 15 款前沿 AI 聊天机器人在精神科分诊中的表现,这些情境基于现实中的单条消息披露,每个情境配对 4 个原始基准分诊标签之一:A,常规;B,1 周内评估;C,24 至 48 小时内评估;以及 D,立即急诊护理。情境涵盖了 9 个精神科表现簇和 9 个焦点风险维度,组织成 28 个表现-风险组。每组贡献 4 个不同的情境,每个分诊级别 1 个情境。每个情境被呈现为现实的人类撰写的对话查询,AI 聊天机器人的任务是根据该披露分配一个分诊标签。在 410 次 D 级试验中,有 23 次(5.6%)发生了急诊分诊不足,且所有分诊不足的急诊均被重新分配为 C 级紧迫性。在目标模型中,平均准确率从 42.0% 到 71.8% 不等。D 级情境的准确率最高(94.3%),B 级情境的准确率最低(19.7%)。平均有符号序数误差为正(+0.47 个分诊级别),表明存在净分诊过度。离散度在中间分诊级别周围最高。所有结果均与 50 名医生的医生共识标签进行了对比确认。因此,当面对包含充足临床信息的用户消息时,前沿 AI 聊天机器人能够以接近零的错误率识别出精神科急诊需要紧急医疗评估,但对于低风险和中等风险的表现表现出明显的分诊过度。
引用
@article{arxiv.2604.25415,
title = {One-shot emergency psychiatric triage across 15 frontier AI chatbots},
author = {Veith Weilnhammer and Lennart Luettgau and Christopher Summerfield and Viknesh Sounderajah and Elise Wilkinson and Virginia Corno and Matthew M Nour},
journal= {arXiv preprint arXiv:2604.25415},
year = {2026}
}