中文

面向多语言仇恨语音检测的模型无关元学习

计算与语言 2023-03-07 v1 社会与信息网络

摘要

社交媒体中的仇恨语音是一种日益增长的现象,检测此类有毒内容近来在研究界获得了显著关注。现有研究探索了微调语言模型(LM)以执行仇恨语音检测,这些方案取得了显著性能。然而,这些研究大多仅限于检测英语中的仇恨语音,忽视了以其他语言(尤其是低资源语言)生成的大量仇恨内容。在数据有限的情况下开发能捕捉低资源语言中仇恨语音及其细微差别的分类器极具挑战性。为填补研究空白,我们提出HateMAML,一种基于模型无关元学习(model-agnostic meta-learning)的框架,可有效执行低资源语言中的仇恨语音检测。HateMAML利用自监督策略克服数据稀缺的限制,并产生更好的LM初始化,以快速适应未见过的目标语言(即跨语言迁移)或其他仇恨语音数据集(即域泛化)。在涵盖八种不同低资源语言的五个数据集上进行了大量实验。结果表明,在跨域多语言迁移设定下,HateMAML比最先进的基线高出3%以上。我们还进行了消融实验以分析HateMAML的特性。

关键词

引用

@article{arxiv.2303.02513,
  title  = {Model-Agnostic Meta-Learning for Multilingual Hate Speech Detection},
  author = {Md Rabiul Awal and Roy Ka-Wei Lee and Eshaan Tanwar and Tanmay Garg and Tanmoy Chakraborty},
  journal= {arXiv preprint arXiv:2303.02513},
  year   = {2023}
}