阿姆哈拉语 abusive speech 的埃塞俄比亚推特数据集分析
计算与语言
2019-12-11 v1 社会与信息网络
摘要
在本文中,我们针对用于识别 abusive speech 的阿姆哈拉语,提出了首个埃塞俄比亚推特数据集的分析。该数据集自2014年起收集,以 Fidel 文字书写。由于多种语言可用 Fidel 文字书写,我们利用现有的阿姆哈拉语、提格里尼亚语和吉兹语语料库仅保留阿姆哈拉语推文。我们分析了推文中的 abusive speech 内容,目标如下:分析 abusive speech 内容随时间分布的倾向,并比较推特语料与通用参考阿姆哈拉语语料之间的 abusive speech 内容。
引用
@article{arxiv.1912.04419,
title = {Analysis of the Ethiopic Twitter Dataset for Abusive Speech in Amharic},
author = {Seid Muhie Yimam and Abinew Ali Ayele and Chris Biemann},
journal= {arXiv preprint arXiv:1912.04419},
year = {2019}
}