当症状不足以判定时:大语言模型精神病学筛查中的证据加权模式
计算与语言
2026-05-26 v2 计算机与社会
摘要
随着心理健康护理的需求超过临床医生提供的评估,对可扩展筛查工具的需求日益增加。大语言模型可能从患者叙述中识别精神病学风险,但其在不同诊断、人口统计学亚组及证据使用模式上的可靠性仍不确定。我们引入了一个以 SCID 为锚定的基准,包含 555 次半结构化经验访谈,并配有焦虑症、重度抑郁症、创伤后应激障碍及任何当前心理健康障碍的诊断参考标签。使用零样本特定任务提示,我们评估了五个 SOTA LLM,并检查了假阴性错误是否反映了遗漏的精神病学证据,或对症状、功能损害及保护性情境线索的差异性加权。性能因任务和模型而异,准确率从 0.49 到 0.86,Matthews 相关系数从 0.16 到 0.38。GPT-4.1 Mini 和 GPT-5 Mini 表现出最一致的特定障碍准确率。亚组分析发现,男性参与者的抑郁分类准确率高于女性,未发现一致的年龄相关模式,且在不同种族分层中存在适度的非均匀变异。证据整合分析表明,焦虑与 PTSD 的假阴性分类通常包含明确的症状证据,但伴随有功能保留、应对能力或社会支持。功能损害证据将模型输出推向阳性分类,而保护性情境证据则使输出偏离。这些发现表明,LLM 可能支持可扩展的精神病学筛查,但其在功能保留或保护性情境存在时忽视症状证据的倾向要求在临床部署前进行仔细验证。
引用
@article{arxiv.2605.23148,
title = {When Symptoms Are Not Enough: Evidence-Weighting Patterns in Large Language Model Psychiatric Screening},
author = {Jianfeng Zhu and Megan Korhummel and Ruoming Jin and Karin G. Coifman},
journal= {arXiv preprint arXiv:2605.23148},
year = {2026}
}
备注
25 pages 7 figures