评估用于抑郁检测的机器学习分类算法与 NLP 技术:实验案例研究
计算与语言
2024-04-09 v1
摘要
抑郁已影响全球数百万人,成为最常见的精神疾病之一。早期精神疾病检测可降低公共卫生机构的成本,并防止其他主要伴随疾病的发生。此外,专业人士短缺是一个极具担忧因素,因为抑郁诊断高度依赖于专家专业人员且耗时。最近的研究表明,机器学习(ML)和自然语言处理(NLP)工具和技术显著改善了抑郁诊断。然而,在评估抑郁检测方法时,仍面临若干挑战,其中包括存在 Post-Traumatic Stress Disorder(PTSD)等其他条件。这些挑战包括评估数据清洗和预处理技术、特征选择以及合适的 ML 分类算法。本文基于案例研究评估了这些问题,重点在于数据清洗和预处理、特征选择、参数设置和模型选择方面的不同 ML 分类器的比较。该案例研究基于 Distress Analysis Interview Corpus - Wizard-of-Oz(DAIC-WOZ)数据集,该数据集旨在支持诊断如抑郁、焦虑和 PTSD 等精神疾病。除了评估替代技术外,我们能够构建约达 84% 准确率的模型,具体为 Random Forest 和 XGBoost 模型,这显著高于文献中使用 SVM 模型获得的 72% 准确率。
关键词
引用
@article{arxiv.2404.04284,
title = {Assessing ML Classification Algorithms and NLP Techniques for Depression Detection: An Experimental Case Study},
author = {Giuliano Lorenzoni and Cristina Tavares and Nathalia Nascimento and Paulo Alencar and Donald Cowan},
journal= {arXiv preprint arXiv:2404.04284},
year = {2024}
}