中文

PsychCounsel-Bench:评估大语言模型的心理学智能

人工智能 2025-11-14 v4 计算与语言

摘要

大语言模型 (LLM) 在广泛行业取得了显著成功,主要源于其出色的生成能力。然而,其在需要认知能力的应用,如心理咨询领域的潜力尚未得到充分挖掘。本文旨在回答关键问题:\textit{大语言模型能否有效应用于心理咨询?} 为了判断 LLM 是否能够胜任心理咨询师角色,第一步是评估其是否满足该角色所需的资格,即是否通过美国国家咨询师认证考试 (NCE)。因为人类咨询师必须通过认证考试才能执业,LLM 也必须展示足够的心理学知识以满足该角色的标准。为此,我们引入了 PsychCounsel-Bench,一个基于美国国家咨询师考试的基准测试,这是一项约需 70\% 正确率才能通过的执业资格测试。PsychCounsel-Bench 包含约 2252 个精心挑选的单选题,旨在要求深入理解并覆盖心理学的各个子领域。该基准提供了全面评估 LLM 作为咨询师能力的手段。我们的评估显示,像 GPT-4o、Llama3.3-70B 和 Gemma3-27B 这样的高级模型准确率显著超过通过阈值,而较小的开源模型(如 Qwen2.5-7B、Mistral-7B)则远低于该阈值。这些结果表明,只有前沿 LLM 目前才具备满足咨询考试标准的能力,凸显了开发面向心理学的 LLM 的潜力与挑战。我们发布了该数据集以供公众使用:https://github.com/cloversjtu/PsychCounsel-Bench

关键词

引用

@article{arxiv.2510.01611,
  title  = {PsychCounsel-Bench: Evaluating the Psychology Intelligence of Large Language Models},
  author = {Min Zeng},
  journal= {arXiv preprint arXiv:2510.01611},
  year   = {2025}
}