Cognitive-Mental-LLM:通过在线文本评估大型语言模型推理能力以进行心理健康预测
计算与语言
2026-01-09 v3 人工智能
摘要
大型语言模型(LLM)在从在线文本预测心理健康结果方面展现了潜力,但传统分类方法通常缺乏可解释性和鲁棒性。本研究评估了结构化推理技术——思维链(CoT)、自一致性(SC-CoT)和思维树(ToT)——以提高来自Reddit的多个心理健康数据集上的分类准确率。我们分析了推理驱动的提示策略,包括零样本CoT和少样本CoT,使用平衡准确率、F1分数和灵敏度/特异度等关键性能指标。我们的结果表明,推理增强技术相较于直接预测改善了分类性能,特别是在复杂情况下。与零样本非CoT提示以及微调预训练变换器(如BERT和Mental-RoBerta)和微调开源LLM(如Mental Alpaca和Mental-Flan-T5)等基线相比,推理驱动的LLM在Dreaddit数据集(相较于M-LLM提升+0.52%,相较于BERT提升+0.82%)和SDCNL数据集(相较于M-LLM提升+4.67%,相较于BERT提升+2.17%)上取得了显著提升。然而,抑郁症严重程度和CSSRS预测的性能下降表明数据集特定的局限性,这可能是由于我们使用了更广泛的测试集所致。在提示策略中,少样本CoT始终优于其他方法,进一步证实了推理驱动LLM的有效性。尽管如此,数据集的变异性凸显了模型可靠性和可解释性方面的挑战。本研究为基于推理的LLM技术用于心理健康文本分类提供了全面的基准。它为其在可扩展临床应用中的潜力提供了见解,同时指出了未来改进的关键挑战。
引用
@article{arxiv.2503.10095,
title = {Cognitive-Mental-LLM: Evaluating Reasoning in Large Language Models for Mental Health Prediction via Online Text},
author = {Avinash Patil and Amardeep Kour Gedhu},
journal= {arXiv preprint arXiv:2503.10095},
year = {2026}
}
备注
8 pages, 4 Figures, 3 tables