中文

Dreaddit:用于社交媒体压力分析的 Reddit 数据集

计算与语言 2019-11-04 v1

摘要

压力是一种近乎普遍的人类体验,尤其在在线世界中。虽然压力可以是一种激励,但过多压力与许多负面健康结果相关,使其在各领域的识别都很有用。然而,现有的计算研究通常仅研究诸如语音等域中的压力,或 Twitter 等短文本体裁中的压力。我们提出 Dreaddit,一个用于压力识别的、来自长篇多领域社交媒体数据的新文本语料库。我们的数据集由来自五类不同 Reddit 社区的 19 万篇帖子组成;我们还使用 Amazon Mechanical Turk 对取自 3 千篇帖子的共 3.5 千个片段进行了标注。我们给出了识别压力的初步监督学习方法,包括神经与传统方法,并分析了数据的复杂性与多样性以及各类别的特征。

关键词

引用

@article{arxiv.1911.00133,
  title  = {Dreaddit: A Reddit Dataset for Stress Analysis in Social Media},
  author = {Elsbeth Turcan and Kathleen McKeown},
  journal= {arXiv preprint arXiv:1911.00133},
  year   = {2019}
}

备注

To appear in the proceedings of the Tenth International Workshop on Health Text Mining and Information Analysis