中文

阿姆哈拉语 abusive speech 的埃塞俄比亚推特数据集分析

计算与语言 2019-12-11 v1 社会与信息网络

摘要

在本文中,我们针对用于识别 abusive speech 的阿姆哈拉语,提出了首个埃塞俄比亚推特数据集的分析。该数据集自2014年起收集,以 Fidel 文字书写。由于多种语言可用 Fidel 文字书写,我们利用现有的阿姆哈拉语、提格里尼亚语和吉兹语语料库仅保留阿姆哈拉语推文。我们分析了推文中的 abusive speech 内容,目标如下:分析 abusive speech 内容随时间分布的倾向,并比较推特语料与通用参考阿姆哈拉语语料之间的 abusive speech 内容。

关键词

引用

@article{arxiv.1912.04419,
  title  = {Analysis of the Ethiopic Twitter Dataset for Abusive Speech in Amharic},
  author = {Seid Muhie Yimam and Abinew Ali Ayele and Chris Biemann},
  journal= {arXiv preprint arXiv:1912.04419},
  year   = {2019}
}