事半功倍:在数据稀缺下改进有毒语言分类
计算与语言
2020-10-27 v2
摘要
某些类型有毒语言的检测受限于标注训练数据的极度稀缺。数据增强——从标注种子数据集生成新的合成数据——或有所帮助。数据增强对有毒语言分类的效力尚未被充分探索。我们呈现首项系统性研究,考察数据增强技术如何影响各类有毒语言分类器的性能,涵盖从浅层逻辑回归架构到BERT——一种最先进的预训练Transformer网络。我们在极稀缺种子数据集上比较八种技术的性能。我们表明,尽管BERT表现最佳,浅层分类器在经三种技术(含GPT-2生成句子)组合增强的数据上训练时表现相当。我们讨论性能与计算开销的相互作用,可为不同约束下的技术选择提供依据。
引用
@article{arxiv.2009.12344,
title = {A little goes a long way: Improving toxic language classification despite data scarcity},
author = {Mika Juuti and Tommi Gröndahl and Adrian Flanagan and N. Asokan},
journal= {arXiv preprint arXiv:2009.12344},
year = {2020}
}
备注
To appear in Findings of ACL: EMNLP 2020