对抗数据稀缺下隐式仇恨语音分类中的高方差
计算与语言
2022-08-30 v1 机器学习
摘要
仇恨语音分类一直是自然语言处理中的长期问题。然而,尽管存在众多仇恨语音检测方法,它们通常因仇恨陈述本质上的隐式性而忽略大量此类语句。构建用于辅助隐式仇恨语音分类任务的数据集有其自身挑战:语言中的细微差别、对何为仇恨语音的定义不一,以及标注此类数据的劳动密集型过程。这导致可用于训练和测试此类系统的数据稀缺,当使用参数繁重的基于transformer的模型来解决该问题时,会引发高方差问题。在本文中,我们探索多种优化与正则化技术,并开发了一种新颖的基于RoBERTa的模型,取得了最先进的性能。
引用
@article{arxiv.2208.13595,
title = {Combating high variance in Data-Scarce Implicit Hate Speech Classification},
author = {Debaditya Pal and Kaustubh Chaudhari and Harsh Sharma},
journal= {arXiv preprint arXiv:2208.13595},
year = {2022}
}
备注
4 pages, 3 tables