异构语境下的滥用语言检测:数据集构建与监督注意力机制的作用
计算与语言
2021-05-25 v1 人工智能
摘要
滥用语言是在线社交平台上的一个巨大问题。现有的滥用语言检测技术尤其不适用于包含异构滥用语言模式(即既含滥用部分又含非滥用部分)的评论。这部分归因于缺乏显式标注滥用语言异构性的数据集。我们通过提供一份来自 YouTube 的超过 11,000 条评论的滥用语言标注数据集来应对这一挑战。我们在该数据集中通过分别标注整条评论及其所包含的各独立句子来考量异构性。随后,我们提出一种算法,利用监督注意力机制并通过多任务学习来检测与分类滥用内容。我们通过实证展示了在传统技术上处理异构内容的挑战,以及所提方法相较最先进方法在性能上的相对提升。
引用
@article{arxiv.2105.11119,
title = {Abusive Language Detection in Heterogeneous Contexts: Dataset Collection and the Role of Supervised Attention},
author = {Hongyu Gong and Alberto Valido and Katherine M. Ingram and Giulia Fanti and Suma Bhat and Dorothy L. Espelage},
journal= {arXiv preprint arXiv:2105.11119},
year = {2021}
}
备注
AAAI 2021 (AI for Social Impact track)