中文

基于机器学习方法检测 Twitter 上潜在有害与保护性的自杀相关内容

计算与语言 2022-06-29 v3 机器学习

摘要

研究表明,暴露于与自杀相关的新闻媒体内容与自杀率相关,其中某些内容特征可能具有有害影响,而其他特征可能具有保护性作用。尽管针对少数选定特征存在充分证据,但总体上缺乏系统性的大规模研究,尤其是针对社交媒体数据的研究。我们应用机器学习方法,依据一种区分 12 类自杀相关推文的新标注方案对大量 Twitter 数据进行分类。随后我们训练了一组机器学习模型基准,包括多数类分类器、基于词频的方法(TF-IDF 与线性 SVM)以及两个最先进的深度学习模型(BERT、XLNet)。这两个深度学习模型在两项分类任务中取得了最佳性能:在第一项任务中,我们对六类主要内容进行分类,包括关于自杀意念与尝试或应对的个人故事、旨在传播问题意识或预防相关信息的行动呼吁、自杀案例报告,以及与其他类别无关的其他推文。深度学习模型在六类上的平均准确率超过 73%,除自杀意念与尝试类别(0.51-0.55)外,所有类别的 F1 分数介于 0.70 和 0.85 之间。在第二项任务中,将指代实际自杀的推文与离题推文分离,它们正确标注了约 88% 的推文,BERT 对两类分别取得了 0.93 和 0.74 的 F1 分数。这些分类性能可与类似任务上的最先进水平(SOTA)相媲美。通过提高数据标注效率,本工作实现了对社交媒体内容中有害与保护性因素与自杀率及求助行为关联的大规模研究。

关键词

引用

@article{arxiv.2112.04796,
  title  = {Detecting potentially harmful and protective suicide-related content on twitter: A machine learning approach},
  author = {Hannah Metzler and Hubert Baginski and Thomas Niederkrotenthaler and David Garcia},
  journal= {arXiv preprint arXiv:2112.04796},
  year   = {2022}
}