基于社交媒体文本的抑郁症状建模:一种半监督学习方法
计算与语言
2022-09-30 v3 人工智能
机器学习
摘要
基于用户级社交媒体语言的临床抑郁建模的一个基本组成部分是抑郁症状检测(DSD)。遗憾的是,目前不存在反映临床洞察且来自自我披露抑郁人群样本的抑郁症状分布的 DSD 数据集。在我们的工作中,我们描述了一个半监督学习(SSL)框架,其使用一个初始监督学习模型,该模型利用 1)在 clinician 标注的 DSD 数据集上进一步微调的最先进大型心理健康论坛文本预训练语言模型,2)用于 DSD 的零样本学习模型,并将它们耦合以从我们大型自构建的抑郁推文库(DTR)中采集抑郁症状相关样本。我们的 clinician 标注数据集是同类中最大的。此外,DTR 由来自两个数据集的自我披露抑郁用户 Twitter 时间线推文样本创建,其中包括最大的用户级 Twitter 抑郁检测基准数据集之一。这进一步有助于保留自我披露 Twitter 用户推文的抑郁症状分布。随后,我们用采集的数据迭代地重新训练初始 DSD 模型。我们讨论了该 SSL 过程的停止标准和局限性,并阐述了在整体 SSL 过程中起关键作用的基本构念。我们表明我们可以生成同类中最大的最终数据集。此外,在其上训练的 DSD 和抑郁帖子检测(DPD)模型比其初始版本取得了显著更好的准确率。
引用
@article{arxiv.2209.02765,
title = {Depression Symptoms Modelling from Social Media Text: A Semi-supervised Learning Approach},
author = {Nawshad Farruque and Randy Goebel and Sudhakar Sivapalan and Osmar Zaiane},
journal= {arXiv preprint arXiv:2209.02765},
year = {2022}
}
备注
Title and relevant changes are made