中文

对抗数据稀缺下隐式仇恨语音分类中的高方差

计算与语言 2022-08-30 v1 机器学习

摘要

仇恨语音分类一直是自然语言处理中的长期问题。然而,尽管存在众多仇恨语音检测方法,它们通常因仇恨陈述本质上的隐式性而忽略大量此类语句。构建用于辅助隐式仇恨语音分类任务的数据集有其自身挑战:语言中的细微差别、对何为仇恨语音的定义不一,以及标注此类数据的劳动密集型过程。这导致可用于训练和测试此类系统的数据稀缺,当使用参数繁重的基于transformer的模型来解决该问题时,会引发高方差问题。在本文中,我们探索多种优化与正则化技术,并开发了一种新颖的基于RoBERTa的模型,取得了最先进的性能。

关键词

引用

@article{arxiv.2208.13595,
  title  = {Combating high variance in Data-Scarce Implicit Hate Speech Classification},
  author = {Debaditya Pal and Kaustubh Chaudhari and Harsh Sharma},
  journal= {arXiv preprint arXiv:2208.13595},
  year   = {2022}
}

备注

4 pages, 3 tables