希伯来语攻击性语料库及基于 BERT 的检测
计算与语言
2023-09-07 v1 人工智能
机器学习
摘要
攻击性语言检测已在多种语言中得到充分研究,但在希伯来语等低资源语言中仍相对滞后。本文提出一个新的希伯来语攻击性语言语料库。我们从 Twitter 获取了共计 15,881 条推文,每条由阿拉伯-希伯来双语使用者标注为五类(辱骂、仇恨、暴力、色情或无攻击性)中的一类或多类。标注过程颇具挑战,因每位标注者需熟悉以色列文化、政治与习俗以理解每条推文的语境。我们使用所提数据集及另一已发布数据集微调了两个希伯来语 BERT 模型:HeBERT 与 AlephBERT。我们观察到,当与 D_OLaH 结合时,我们的数据使 HeBERT 性能提升 2%。在我们的数据上微调 AlephBERT 并在 D_OLaH 上测试取得 69% 准确率,而在 D_OLaH 上微调并在我们的数据上测试取得 57% 准确率,这可能表明我们的数据具有可泛化性。我们的数据集与微调模型已在 GitHub 与 Huggingface 上公开。
引用
@article{arxiv.2309.02724,
title = {Offensive Hebrew Corpus and Detection using BERT},
author = {Nagham Hamad and Mustafa Jarrar and Mohammad Khalilia and Nadim Nashif},
journal= {arXiv preprint arXiv:2309.02724},
year = {2023}
}
备注
8 pages, 1 figure, The 20th ACS/IEEE International Conference on Computer Systems and Applications (AICCSA)