中文

捕捞挑衅者:一个数据集

计算机与社会 2020-08-04 v1 社会与信息网络

摘要

自动准确地检测与过滤攻击性内容的能力对于保障丰富多元的数字话语十分重要。挑衅(trolling)是社交媒体中普遍存在的伤害性或攻击性内容类型,但在用于攻击性内容检测的数据集中代表性不足。在本工作中,我们提出一个将挑衅建模为攻击性内容子类别的数据集。该数据集通过从知名数据集中收集样本并依据不同攻击性内容类别的精确定义重新标注而创建。数据集包含12,490个样本,划分为5类:正常、亵渎、挑衅、贬损与仇恨言论。它涵盖来自Twitter、Reddit和Wikipedia Talk Pages的内容。在我们的数据集上训练的模型无需显著超参数调优即展现出可观性能,并可能有效学习到有意义的语言信息。我们发现这些模型对数据消融敏感,这表明该数据集大体上不含可能干扰并混淆分类模型的伪统计伪影。

关键词

引用

@article{arxiv.2008.00525,
  title  = {Trawling for Trolling: A Dataset},
  author = {Hitkul and Karmanya Aggarwal and Pakhi Bamdev and Debanjan Mahata and Rajiv Ratn Shah and Ponnurangam Kumaraguru},
  journal= {arXiv preprint arXiv:2008.00525},
  year   = {2020}
}