中文

面向多标签分类的韩语在线仇恨言论数据集:社会科学如何改进仇恨言论数据集?

计算与语言 2022-04-11 v2 计算机与社会

摘要

我们提出了一个多标签韩语在线仇恨言论数据集,涵盖七类仇恨言论:(1)种族与国籍,(2)宗教,(3)地域主义,(4)年龄歧视,(5)厌女症,(6)性少数群体,以及(7)男性。我们的35K数据集包含24K条在线评论,其Krippendorff's Alpha标签一致性为.713,2.2K条来自维基百科的中性句子,1.7K条通过“人在回路”程序生成的额外标注句子,以及7.1K条规则生成的中性句子。基于24K初始数据集的基础模型达到了LRAP .892的准确率,但在与11K额外数据结合后提升至.919。与传统的仇恨与非仇恨二元划分方法不同,我们设计了一个兼顾文化和语言背景的数据集,以克服基于西方文化的英文文本的局限性。因此,本文不仅限于呈现一个本地仇恨言论数据集,更延伸为一份基于社会科学视角,构建具有多元文化背景的更通用仇恨言论数据集的指南。

关键词

引用

@article{arxiv.2204.03262,
  title  = {Korean Online Hate Speech Dataset for Multilabel Classification: How Can Social Science Improve Dataset on Hate Speech?},
  author = {TaeYoung Kang and Eunrang Kwon and Junbum Lee and Youngeun Nam and Junmo Song and JeongKyu Suh},
  journal= {arXiv preprint arXiv:2204.03262},
  year   = {2022}
}

备注

12 pages, 3 tables