评估大型语言模型在危机检测中的表现:来自心理支持热线的真实世界基准
计算与语言
2025-12-19 v2 人工智能
摘要
心理支持热线作为危机干预的关键生命线,但由于需求不断增长和资源有限,面临着重大挑战。大型语言模型(LLM)在危机评估中提供了潜在支持,但其在情感敏感的真实世界临床环境中的有效性仍有待探索。我们引入了 PsyCrisisBench,这是一个包含来自杭州心理援助热线 540 份标注转录文本的综合基准,用于评估四项关键任务:情绪状态识别、自杀意念检测、自杀计划识别和风险评估。我们使用零样本、少样本和微调范式评估了 15 个模型系列中的 64 个 LLM(包括 GPT、Claude、Gemini 等闭源模型以及 Llama、Qwen、DeepSeek 等开源模型)。LLM 在自杀意念检测(F1=0.880)、自杀计划识别(F1=0.779)和风险评估(F1=0.907)方面表现出强劲的结果,少样本提示和微调带来了显著提升。与受过训练的人工接线员相比,LLM 在自杀计划识别和风险评估上取得了相当或更优的表现,而人类在情绪状态识别和自杀意念检测上保持优势。情绪状态识别仍然具有挑战性(最高 F1=0.709),这可能是由于缺失语音线索和语义歧义。值得注意的是,一个微调的 1.5B 参数模型(Qwen2.5-1.5B)在情绪和自杀意念任务上优于更大的模型。LLM 在基于文本的危机评估中表现出与受过训练的人工接线员大致相当的性能,并在不同任务类型上展现出互补优势。PsyCrisisBench 提供了一个稳健的真实世界评估框架,以指导未来的模型开发和临床心理健康中的伦理部署。
引用
@article{arxiv.2506.01329,
title = {Evaluating Large Language Models in Crisis Detection: A Real-World Benchmark from Psychological Support Hotlines},
author = {Guifeng Deng and Shuyin Rao and Tianyu Lin and Anlu Dai and Pan Wang and Junyi Xie and Haidong Song and Ke Zhao and Dongwu Xu and Zhengdong Cheng and Tao Li and Haiteng Jiang},
journal= {arXiv preprint arXiv:2506.01329},
year = {2025}
}
备注
Preprint. Submitted to IEEE Journal of Biomedical and Health Informatics (under review)