中文

大型语言模型的心理咨询能力

机器学习 2025-03-12 v1 人工智能 计算与语言 计算机与社会

摘要

随着科学进步和人工智能技术的持续发展,大型语言模型(LLMs)已在各个领域广泛应用。然而,在心理咨询领域,LLM 的能力尚未进行系统评估。本研究使用从中国国家咨询师三级考试中选取的1096个心理咨询技能问题,对主流 LLM 进行了心理咨询能力评估,这些问题包括知识型、分析型和应用型问题类型。分析结果显示,LLM 对中文问题的正确率按降序排列为:GLM-3(46.5%)、GPT-4(46.1%)、Gemini(45.0%)、ERNIE-3.5(45.7%)和 GPT-3.5(32.9%)。LLM 对英文问题的正确率按降序排列为:ERNIE-3.5(43.9%)、GPT-4(40.6%)、Gemini(36.6%)、GLM-3(29.9%)和 GPT-3.5(29.5%)。卡方检验表明,LLM 在中文和英文问题上的表现存在显著差异。进一步地,我们以咨询师指南(三级)作为参考,对 ERNIE-3.5 进行了调整,新的正确率为 59.6%,比其初始率的 45.8% 提高了 13.8%。总之,本研究首次评估了 LLM 的心理咨询能力,这可能为未来提升和改进 LLM 的心理咨询能力提供了见解。

关键词

引用

@article{arxiv.2503.07627,
  title  = {Psychological Counseling Ability of Large Language Models},
  author = {Fangyu Peng and Jingxin Nie},
  journal= {arXiv preprint arXiv:2503.07627},
  year   = {2025}
}

备注

25 pages, 1 figure