中文

PsyEval:用于评估大语言模型的心理健康相关任务套件

计算与语言 2024-06-04 v2

摘要

鉴于症状具有细微且高度主观、在个体间表现出显著变异性的特点,在心理健康领域评估大语言模型(LLM)相较于其他领域面临独特的挑战。本文提出 PsyEval,这是首个用于评估 LLM 的心理健康相关任务的综合性套件。PsyEval 包含五个子任务,评估心理健康的三个关键维度。该综合框架旨在全面评估心理健康相关任务所特有的挑战与复杂性,使 PsyEval 成为在该领域评估 LLM 性能的高度专业化且有价值的工具。我们使用 PsyEval 对十二个先进 LLM 进行了评估。实验结果不仅表明当前 LLM 在心理健康方面仍有显著改进空间,也揭示了未来模型优化的潜在方向。

关键词

引用

@article{arxiv.2311.09189,
  title  = {PsyEval: A Suite of Mental Health Related Tasks for Evaluating Large Language Models},
  author = {Haoan Jin and Siyuan Chen and Dilawaier Dilixiati and Yewei Jiang and Mengyue Wu and Kenny Q. Zhu},
  journal= {arXiv preprint arXiv:2311.09189},
  year   = {2024}
}