评估基础模型在心理健康问答分类中的有效性
计算与语言
2024-06-25 v1 人工智能
摘要
预训练语言模型(PLMs)通过提供可访问且文化敏感的資源,具有变革心理健康支持的潜力。然而,尽管有这种潜力,它们在心理健康护理领域,特别是针对阿拉伯语的有效性尚未得到广泛探索。为弥补这一空白,本研究评估了基础模型在心理健康护理领域问答(Q&A)分类中的有效性。我们利用了 MentalQA 数据集,这是一个包含与心理健康相关的问答交互的阿拉伯语数据集。在本研究中,我们使用四种不同的学习方法进行了实验:传统特征提取、PLMs 作为特征提取器、微调 PLMs 以及在零样本和少样本学习设置中提示大型语言模型(GPT-3.5 和 GPT-4)。虽然结合支持向量机(SVM)的传统特征提取器表现出有前景的性能,但 PLMs 由于其捕捉语义含义的能力而展现出更好的结果。例如,MARBERT 在问题分类中取得了 0.80 的 Jaccard 分数,在答案分类中取得了 0.86 的 Jaccard 分数,达到了最高性能。我们进一步进行了深入分析,包括检查微调与非微调的效果、不同数据量的影响以及进行错误分析。我们的分析表明,微调有助于提升 PLMs 的性能,并且训练数据的大小在实现高性能方面起着关键作用。我们还探索了提示方法,其中使用 GPT-3.5 的少样本学习取得了有前景的结果。问题和答案分类分别提高了 12% 和 45%。基于我们的发现,可以得出结论,PLMs 和基于提示的方法在阿拉伯语心理健康支持方面具有前景。
引用
@article{arxiv.2406.15966,
title = {Evaluating the Effectiveness of the Foundational Models for Q&A Classification in Mental Health care},
author = {Hassan Alhuzali and Ashwag Alasmari},
journal= {arXiv preprint arXiv:2406.15966},
year = {2024}
}