K-HATERS:带有目标特定评分的韩语仇恨言论检测语料库
计算与语言
2023-10-25 v1 社会与信息网络
摘要
为遏制网络仇恨蔓延,已有众多数据集被提出。尽管有这些努力,多数资源仍以英语为中心,主要关注显性的仇恨形式。这一研究空白呼吁开发多样语言的高质量语料库,同时涵盖更微妙的仇恨表达。本研究介绍 K-HATERS,一个用于韩语仇恨言论检测的新语料库,包含约 192K 条带有目标特定冒犯性评分的新闻评论。该资源是规模最大的韩语攻击性语言语料库,也是首个以三点李克特量表提供目标特定评分的语料库,从而能够按不同冒犯程度检测韩语中的仇恨表达。我们开展了实验以展示所提语料库的有效性,包括与现有数据集的比较。此外,为解决人工标注中的潜在噪声与偏差,我们探索了一种新思路:采用社会科学中广泛使用的认知反射测试作为标注质量的代理指标,以评估个体的认知能力。结果表明,测试得分最低的个体所提供的标注往往导致检测模型对特定目标群体做出有偏预测且准确性较低。本研究有助于仇恨言论检测与自然语言处理资源构建研究。代码与数据集可在 https://github.com/ssu-humane/K-HATERS 获取。
引用
@article{arxiv.2310.15439,
title = {K-HATERS: A Hate Speech Detection Corpus in Korean with Target-Specific Ratings},
author = {Chaewon Park and Soohwan Kim and Kyubyong Park and Kunwoo Park},
journal= {arXiv preprint arXiv:2310.15439},
year = {2023}
}
备注
15 pages, EMNLP 2023 (Findings)