中文

基于 transformer 模型和辅助特征的社交媒体帖子抑郁检测

计算与语言 2024-10-01 v1

摘要

社交媒体帖子中的抑郁检测因精神健康问题的日益普及而至关重要。传统机器学习算法往往无法捕捉复杂的文本模式,限制了其在识别抑郁方面的有效性。现有研究探索了 various 方法,但在准确性和鲁棒性方面常常不足。为此,本研究提出一种神经网络架构,利用基于 transformer 的模型结合元数据和语言标记。该研究采用 DistilBERT,从 transformer 的最后四层中提取信息,应用学习到的权重并对其进行平均,以创建输入文本的丰富表示。该表示经过元数据和语言标记的增强,提高了模型对每篇帖子的理解能力。Dropout 层防止过拟合,采用多层感知器(MLP)进行最终分类。还采用受易数据增强(EDA)方法启发的数据增强技术,以提高模型性能。使用 BERT,随机插入和替换短语以生成额外的训练数据,重点在于通过对 underrepresented 类进行增强来平衡数据集。该提出的模型实现了加权精确率、召回率和 F1 分数的 84.26%、84.18% 和 84.15%。数据增强技术显著提高了模型性能,将加权 F1 分数从 72.59% 提升到 84.15%。

关键词

引用

@article{arxiv.2409.20048,
  title  = {Depression detection in social media posts using transformer-based models and auxiliary features},
  author = {Marios Kerasiotis and Loukas Ilias and Dimitris Askounis},
  journal= {arXiv preprint arXiv:2409.20048},
  year   = {2024}
}

备注

Social Network Analysis and Mining (Accepted)