面向大型语言模型的心理健康领域新颖对话评估框架
计算与语言
2024-03-18 v1 人工智能
新兴技术
摘要
了解大型语言模型(LLMs)的对话能力有助于更谨慎、适当地部署其应用。这在安全关键领域尤其重要,例如心理健康领域,因为对紧急问题的确切表述可能关乎生命。本文提出一种新颖的框架,用于评估LLMs的细腻对话能力。我们在其中开发了一系列从心理治疗对话分析文献中提炼的量化指标。虽然确保我们的框架和指标可被研究人员移植到相关相邻领域,但我们将其应用于心理健康领域。我们使用该框架评估了几款主流前沿LLMs,包括一些GPT和Llama模型,通过一个经过验证的心理健康数据集。我们的结果显示,GPT4 Turbo在与经过验证的治疗师的表现上显著优于其他所选LLMs。我们进一步分析了LLM对话表现在特定心理健康主题上的差异。结果表明,GPT4 Turbo在育儿和人际关系等特定主题上表现良好,能够实现与治疗师高度相关。我们相信,这些贡献将帮助研究人员开发更好的LLMs,从而更积极地支持人们的生活。
关键词
引用
@article{arxiv.2403.09705,
title = {A Novel Nuanced Conversation Evaluation Framework for Large Language Models in Mental Health},
author = {Alexander Marrapese and Basem Suleiman and Imdad Ullah and Juno Kim},
journal= {arXiv preprint arXiv:2403.09705},
year = {2024}
}