中文

大型语言模型是否符合核心心理健康咨询能力要求?

计算与语言 2025-02-28 v2 人工智能

摘要

大型语言模型(LLMs)的快速发展为全球心理健康专业人员短缺问题提供了一种有前景的解决方案。然而,它们与基本咨询能力的符合程度仍未得到充分探索。我们引入了 CounselingBench,这是一个基于 NCMHCE 的新型基准测试,用于评估 22 个通用和医学微调的 LLMs 在五项关键能力上的表现。虽然前沿模型超过了最低能力阈值,但未能达到专家级表现,它们在接诊、评估与诊断方面表现出色,但在核心咨询属性以及专业实践与伦理方面表现挣扎。令人惊讶的是,医学 LLMs 在准确性上并未优于通用模型,尽管它们提供了稍好的理由说明,但犯了更多与上下文相关的错误。这些发现凸显了开发用于心理健康咨询的 AI 所面临的挑战,尤其是在需要共情和细致推理的能力方面。我们的结果强调了在现实世界部署之前,需要专门的、经过微调的模型,这些模型需符合核心心理健康咨询能力,并辅以人类监督。与本文相关的代码和数据可在以下网址找到:https://github.com/cuongnguyenx/CounselingBench。

关键词

引用

@article{arxiv.2410.22446,
  title  = {Do Large Language Models Align with Core Mental Health Counseling Competencies?},
  author = {Viet Cuong Nguyen and Mohammad Taher and Dongwan Hong and Vinicius Konkolics Possobom and Vibha Thirunellayi Gopalakrishnan and Ekta Raj and Zihang Li and Heather J. Soled and Michael L. Birnbaum and Srijan Kumar and Munmun De Choudhury},
  journal= {arXiv preprint arXiv:2410.22446},
  year   = {2025}
}

备注

10 Pages, Accepted to Findings of NAACL 2025