中文

单语与多语 BERT 在仇恨言论检测与文本分类中的比较:以马拉地语为例

计算与语言 2022-11-15 v1 机器学习

摘要

Transformer 是用于广泛自然语言处理任务的最杰出架构。这些模型在大型文本语料库上进行预训练,旨在为文本分类等任务提供最先进的结果。在这项工作中,我们对单语和多语 BERT 模型进行了比较研究。我们聚焦于马拉地语,并在马拉地语的仇恨言论检测、情感分析和简单文本分类数据集上评估这些模型。我们使用标准的多语模型如 mBERT、indicBERT 和 xlm-RoBERTa,并与马拉地语的单语模型 MahaBERT、MahaALBERT 和 MahaRoBERTa 进行比较。我们进一步表明,在五个不同的下游微调实验中,马拉地语单语模型优于多语 BERT 变体。我们还通过冻结 BERT 编码器层来评估这些模型的句子嵌入。我们表明,与多语对应的句子嵌入相比,基于单语 MahaBERT 的模型提供了更丰富的表示。然而,我们观察到这些嵌入不够通用,在域外社交媒体数据集上表现不佳。我们考虑了两个马拉地语仇恨言论数据集 L3Cube-MahaHate、HASOC-2021,一个马拉地语情感分类数据集 L3Cube-MahaSent,以及马拉地语标题、文章分类数据集。

关键词

引用

@article{arxiv.2204.08669,
  title  = {Mono vs Multilingual BERT for Hate Speech Detection and Text Classification: A Case Study in Marathi},
  author = {Abhishek Velankar and Hrushikesh Patil and Raviraj Joshi},
  journal= {arXiv preprint arXiv:2204.08669},
  year   = {2022}
}