中文

事半功倍:在数据稀缺下改进有毒语言分类

计算与语言 2020-10-27 v2

摘要

某些类型有毒语言的检测受限于标注训练数据的极度稀缺。数据增强——从标注种子数据集生成新的合成数据——或有所帮助。数据增强对有毒语言分类的效力尚未被充分探索。我们呈现首项系统性研究,考察数据增强技术如何影响各类有毒语言分类器的性能,涵盖从浅层逻辑回归架构到BERT——一种最先进的预训练Transformer网络。我们在极稀缺种子数据集上比较八种技术的性能。我们表明,尽管BERT表现最佳,浅层分类器在经三种技术(含GPT-2生成句子)组合增强的数据上训练时表现相当。我们讨论性能与计算开销的相互作用,可为不同约束下的技术选择提供依据。

关键词

引用

@article{arxiv.2009.12344,
  title  = {A little goes a long way: Improving toxic language classification despite data scarcity},
  author = {Mika Juuti and Tommi Gröndahl and Adrian Flanagan and N. Asokan},
  journal= {arXiv preprint arXiv:2009.12344},
  year   = {2020}
}

备注

To appear in Findings of ACL: EMNLP 2020