中文

泰语博客中抑郁症检测:数据集与基线

计算与语言 2021-11-09 v1

摘要

我们呈现了首个公开可用的泰语抑郁症检测语料库。我们的语料库由多个在线博客中经专家验证的抑郁症病例编译而成。我们尝试了两种不同的基于LSTM的模型与两种不同的基于BERT的模型。我们使用泰语BERT模型在抑郁症检测上取得了77.53%的准确率。这为后续基于同一语料库的研究者建立了良好的基线。此外,我们指出亟需在与维基百科相比更多样化的语料上训练得到的泰语词嵌入。我们的语料库、代码与训练模型已在Zenodo上公开发布。

关键词

引用

@article{arxiv.2111.04574,
  title  = {Detecting Depression in Thai Blog Posts: a Dataset and a Baseline},
  author = {Mika Hämäläinen and Pattama Patpong and Khalid Alnajjar and Niko Partanen and Jack Rueter},
  journal= {arXiv preprint arXiv:2111.04574},
  year   = {2021}
}

备注

Workshop on Noisy User-generated Text (at EMNLP)