中文

增强孟加拉语抑郁帖子检测:TF-IDF、BERT 和 FastText 嵌入的比较研究

计算与语言 2024-07-15 v1 人工智能

摘要

由于社交媒体的大规模普及,通过社交媒体分析检测用户抑郁状态尤其在语言资源不足的语言(如孟加拉语)方面具有重要重要性。本研究提出了一种扎实的方法,用于识别孟加拉语中的抑郁社交媒体帖子,采用了先进的自然语言处理技术。本工作使用由领域专家标注的数据集,包含抑郁和非抑郁帖子,确保了模型训练和评估的高质量数据。为解决类别不平衡问题,我们采用了对少数类进行随机过采样,从而增强了模型准确检测抑郁帖子的能力。我们探索了 various 数值表示技术,包括术语频率-逆文档频率 (TF-IDF)、双向编码器表示变换器 (BERT) 嵌入和 FastText 嵌入,通过将其集成到基于深度学习的卷积神经网络-双向长短期记忆 (CNN-BiLSTM) 模型中。通过大量实验的结果表明,BERT 方法优于其他方法,达到了 84% 的 F1 分数。这表明 BERT 与 CNN-BiLSTM 架构组合能够有效识别与抑郁内容相关的孟加拉语文本的细微差别。与现有研究方法的比较分析表明,我们的方法在评估指标和数据集标注可靠性方面优于其他方法。我们的研究对开发用于检测孟加拉语抑郁帖子的可靠工具具有重要贡献。通过强调不同嵌入技术和深度学习模型的有效性,该研究为通过社交媒体平台改进心理健康监测铺平了道路。

关键词

引用

@article{arxiv.2407.09187,
  title  = {Enhancing Depressive Post Detection in Bangla: A Comparative Study of TF-IDF, BERT and FastText Embeddings},
  author = {Saad Ahmed Sazan and Mahdi H. Miraz and A B M Muntasir Rahman},
  journal= {arXiv preprint arXiv:2407.09187},
  year   = {2024}
}