中文

在帮助与伤害之间:LLM 心理健康危机处理评估

计算与语言 2026-04-09 v3 计算机与社会

摘要

大语言模型驱动的聊天机器人改变了人们获取信息的方式,尤其是在心理健康等高风险场景中。尽管其具备支持能力,但对自杀意念和自残等危机的安全检测与响应仍不明确,且受限于缺乏统一的危机分类体系和临床评估标准。我们通过创建以下内容来解决这一问题:(1) 包含六个危机类别的分类体系;(2) 来自 12 个心理健康数据集的超过 2,000 条输入数据集,并被分类至这些类别;(3) 临床响应评估协议。我们还使用 LLM 识别危机输入,并审计五个模型的响应安全性与适当性。首先,我们构建了基于临床信息的危机分类体系和评估协议。接着,我们从超过 239,000 条用户输入中筛选出 2,252 个相关样本,随后测试了三个 LLM 的自动分类能力。此外,我们评估了五个模型对用户危机响应的适当性,采用 5 级 Likert 量表从有害 (1) 到适当 (5) 进行评分。尽管部分模型能对显性危机做出可靠响应,但风险依然存在。许多输出结果,尤其是在自残和自杀类别中,是不适当或不安全的。不同模型的表现存在差异;部分模型(如 gpt-5-nano 和 deepseek-v3.2-exp)的伤害率较低,而其他模型(如 gpt-4o-mini 和 grok-4-fast)则生成更多不安全响应。所有模型在处理间接信号、默认回复和上下文错位时均存在困难。这些结果突显了 LLM 迫切需要更好的安全防护、危机检测和上下文感知响应。它们还表明,除规模外,对齐与安全实践对于可靠的危机支持至关重要。我们的分类体系、数据集和评估方法支持持续的 AI 心理健康研究,旨在减少伤害并保护弱势用户。

关键词

引用

@article{arxiv.2509.24857,
  title  = {Between Help and Harm: An Evaluation of Mental Health Crisis Handling by LLMs},
  author = {Adrian Arnaiz-Rodriguez and Miguel Baidal and Erik Derner and Jenn Layton Annable and Mark Ball and Mark Ince and Elvira Perez Vallejos and Nuria Oliver},
  journal= {arXiv preprint arXiv:2509.24857},
  year   = {2026}
}

备注

Accepted for publication in JMIR Mental Health. DOI: 10.2196/88435