中文

基于多语言 Transformer 模型对 Facebook 数据的自动情感与仇恨言论分析

计算与语言 2023-02-01 v1 机器学习

摘要

近年来,学术界和公共讨论中日益形成共识:社交媒体平台(SMP)放大了仇恨和负面情感内容的传播。研究人员已指出,仇恨内容、政治宣传和定向信息如何造成现实危害,包括针对民选政府的叛乱、种族灭绝,以及因世界上部分地区对某些群体的负面言论加剧而导致社会凝聚力破裂。为应对这些问题,SMP 已创建半自动化系统以帮助识别有毒言论。在本文中,我们分析了一个代表性 Facebook 数据集(n=604,703)中仇恨和负面情感内容的统计分布,该数据集通过 648 个公开 Facebook 页面抓取得到,这些页面自称为极右翼印度教民族主义(Hindutva)行动者的支持者(及追随者)。这些页面是通过在 Facebook 和 CrowdTangle 上使用关键词搜索手动识别的,并根据页面名称、页面描述和这些页面上分享的言论被分类为极右翼 Hindutva 页面。我们采用最先进的开源 XLM-T 多语言基于 Transformer 的语言模型,对这些页面在 5.5 年间分享的文本内容进行情感和仇恨言论分析。结果显示了预测情感和仇恨言论标签的统计分布、主要行动者和主要页面类别。我们进一步讨论了这些预训练语言模型的基准性能和局限性。

关键词

引用

@article{arxiv.2301.13668,
  title  = {Automated Sentiment and Hate Speech Analysis of Facebook Data by Employing Multilingual Transformer Models},
  author = {Ritumbra Manuvie and Saikat Chatterjee},
  journal= {arXiv preprint arXiv:2301.13668},
  year   = {2023}
}