KOLD:韩语攻击性语言数据集
计算与语言
2022-11-08 v2 人工智能
摘要
近期攻击性语言检测的发展方向包括层次化建模、识别攻击性语言的类型与目标,以及通过攻击性文本跨度标注与预测实现可解释性。这些改进聚焦于英语,且因文化与语言差异难以迁移至其他语言。本文提出韩语攻击性语言数据集(KOLD),包含40,429条评论,以层次化方式标注了攻击性语言的类型与目标,并附有相应文本跨度的标注。我们从NAVER新闻与YouTube平台收集评论,并提供文章与视频标题作为标注过程的上下文信息。我们将这些标注评论用作韩语BERT与RoBERTa模型的训练数据,发现它们在攻击性检测、目标分类与目标跨度检测上有效,而在目标群体分类与攻击性跨度检测上仍有提升空间。我们发现目标群体分布与现有英语数据集差异显著,并观察到提供上下文信息可提升模型在攻击性检测(+0.3)、目标分类(+1.5)与目标群体分类(+13.1)上的表现。我们公开发布该数据集与基线模型。
引用
@article{arxiv.2205.11315,
title = {KOLD: Korean Offensive Language Dataset},
author = {Younghoon Jeong and Juhyun Oh and Jaimeen Ahn and Jongwon Lee and Jihyung Moon and Sungjoon Park and Alice Oh},
journal= {arXiv preprint arXiv:2205.11315},
year = {2022}
}
备注
9 pages, 2 figures