探索大语言模型在心理健康咨询会话摘要中的效能:一项基准研究
计算与语言
2024-03-01 v1 人机交互
摘要
会话的全面摘要能够实现心理健康咨询的有效连续性,促进有依据的治疗规划。然而,手动摘要带来了重大挑战,将专家的注意力从核心咨询过程中转移开。本研究通过基于方面的摘要,评估了最先进的大语言模型(LLMs)在选择性总结治疗会话各个组成部分方面的有效性,旨在对其性能进行基准测试。我们引入了MentalCLOUDS,一个咨询组件引导的摘要数据集,包含191个咨询会话,其摘要聚焦于三个不同的咨询组件(即咨询方面)。此外,我们评估了11个最先进的LLMs在咨询中处理组件引导摘要任务的能力。生成的摘要使用标准摘要指标进行定量评估,并由心理健康专业人员定性验证。我们的研究结果表明,在咨询组件的所有方面,任务特定的LLMs(如MentalLlama、Mistral和MentalBART)在标准定量指标(如Rouge-1、Rouge-2、Rouge-L和BERTScore)上表现出优越性能。此外,专家评估显示,基于情感态度、负担、伦理性、连贯性、机会成本和感知有效性六个参数,Mistral优于MentalLlama和MentalBART。然而,这些模型存在共同的弱点,即在机会成本和感知有效性指标上显示出改进潜力。
引用
@article{arxiv.2402.19052,
title = {Exploring the Efficacy of Large Language Models in Summarizing Mental Health Counseling Sessions: A Benchmark Study},
author = {Prottay Kumar Adhikary and Aseem Srivastava and Shivani Kumar and Salam Michael Singh and Puneet Manuja and Jini K Gopinath and Vijay Krishnan and Swati Kedia and Koushik Sinha Deb and Tanmoy Chakraborty},
journal= {arXiv preprint arXiv:2402.19052},
year = {2024}
}