中文

基于词典的荷兰语社交媒体种族主义检测

计算与语言 2016-09-01 v1

摘要

我们提出了一种基于词典的方法来检测荷兰语社交媒体评论中的种族主义内容,这些评论取自两个可能吸引种族主义反应的比利时公共社交媒体网站。这些评论由多名标注者标记为种族主义或非种族主义。对于我们的方法,创建了三个话语词典:首先,我们通过从训练数据中检索可能的种族主义术语和更中性的术语来创建词典,然后用更通用的词汇扩充这些术语以消除一些偏差。第二个词典通过使用在大型通用荷兰语文本语料库上训练的 \texttt{word2vec} 模型进行自动扩展而创建。最后,第三个词典通过手动过滤掉不正确的扩展而创建。我们训练了多个支持向量机,使用词典中不同类别的词汇分布作为特征。性能最好的模型使用了手动清理的词典,并在由未见过的荷兰语评论组成的测试集上获得了种族主义类别的 F-score 为 0.46,这些测试评论取自与训练集相同的站点。词典的自动扩展仅略微提升了模型性能,且这种性能提升在统计上不显著。扩展词典的覆盖率确实有所增加这一事实表明,自动添加的词汇确实出现在语料库中,但未能对性能产生有意义的影响。词典、代码以及申请语料库的程序可在 https://github.com/clips/hades 获取。

关键词

引用

@article{arxiv.1608.08738,
  title  = {A Dictionary-based Approach to Racism Detection in Dutch Social Media},
  author = {Stéphan Tulkens and Lisa Hilte and Elise Lodewyckx and Ben Verhoeven and Walter Daelemans},
  journal= {arXiv preprint arXiv:1608.08738},
  year   = {2016}
}

备注

7 pages, presented at the first workshop on Text Analytics for Cybersecurity and Online Safety (TA-COS), collocated with LREC 2016