通过数据增强改进攻击性语言检测
计算与语言
2020-12-08 v1 机器学习
摘要
在社交媒体上检测攻击性语言是一项重要任务。ICWSM-2020 数据挑战赛任务 2 旨在利用包含 10 万条标注推文的众包数据集识别攻击性内容。然而,该数据集存在类别不平衡问题,某些标签与其他类别相比极为稀少(例如,仇恨类仅占数据的 5%)。在本工作中,我们提出 Dager(Data Augmenter),一种基于生成的数据增强方法,可提升在不平衡和低资源数据(如攻击性语言数据集)上的分类性能。Dager 提取给定类别的词汇特征,并利用这些特征引导基于 GPT-2 构建的条件生成器进行生成。生成的文本可作为增强数据加入训练集。我们表明,当我们使用全部数据集的 1% 进行训练(使用 BERT 进行分类)时,应用 Dager 可使数据挑战赛的 F1 分数提升 11%;此外,生成的数据也很好地保留了原始标签。我们在四种不同分类器(BERT、CNN、带注意力的 Bi-LSTM 和 Transformer)上测试 Dager,观察到检测性能的普遍提升,表明我们的方法有效且与分类器无关。
引用
@article{arxiv.2012.02954,
title = {Enhanced Offensive Language Detection Through Data Augmentation},
author = {Ruibo Liu and Guangxuan Xu and Soroush Vosoughi},
journal= {arXiv preprint arXiv:2012.02954},
year = {2020}
}
备注
In ICWSM 2020 Data Challenge. Online