LLM 治疗师行为评估的计算框架
计算与语言
2024-12-02 v2 人机交互
摘要
ChatGPT 等大语言模型 (LLM) 的出现增加了人们将其用作治疗师以解决心理健康挑战及护理资源普遍匮乏问题的兴趣。然而,专家强调亟需对基于 LLM 的心理健康干预进行系统评估,以准确评估其能力和局限性。在此,我们提出了 BOLT,这是一个概念验证性的计算框架,旨在系统评估 LLM 治疗师的对话行为。我们利用上下文学习方法,在 13 种心理治疗方法中定量测量 LLM 的行为。随后,我们将 LLM 的行为与高质量和低质量的人类治疗进行比较。基于动机性访谈疗法的分析表明,LLM 的行为往往更接近低质量治疗中常见的表现,例如在客户分享情绪时提供更高程度的问题解决建议。然而,与低质量治疗不同,LLM 对客户的需求和优势进行了显著更多的反思。我们的发现警示,LLM 治疗师仍需进一步研究以提供一致的高质量护理。
引用
@article{arxiv.2401.00820,
title = {A Computational Framework for Behavioral Assessment of LLM Therapists},
author = {Yu Ying Chiu and Ashish Sharma and Inna Wanyin Lin and Tim Althoff},
journal= {arXiv preprint arXiv:2401.00820},
year = {2024}
}