中文

基于 BERT 的模型通过定制注意力概率进行攻击性语言检测

计算与语言 2021-10-12 v1 人工智能

摘要

本文描述了关于在 transformer 中使用“注意力掩码(Attention Mask)”输入并将此方法用于检测英语和波斯语中攻击性内容的一项新颖研究。论文的主要焦点是提出一种方法论,以提升基于 BERT 的模型在“攻击性语言检测”任务上的性能。因此,我们通过改变“注意力掩码”输入来定制注意力概率,以创建更有效的词嵌入。为此,我们首先(用 BERT 分词器)对所用数据集的训练集进行分词。然后,我们应用多项朴素贝叶斯将这些词元映射为两个概率。这些概率表示在包含该词元的条件下,文本为非攻击性或攻击性的似然。之后,我们利用这些概率定义一个新项,即攻击性分数(Offensive Score)。接下来,我们基于攻击性分数为每种语言创建两个独立的(因所用数据集类型差异)方程,以重新分配“注意力掩码”输入,从而更多关注更具攻击性的短语。最后,我们将 F1-macro 分数作为评估指标,并对 BERT 与 ANN、CNN 和 RNN 的若干组合进行微调,以检验该方法在各种组合上的效果。结果表明所有模型均因该方法而提升。英语和波斯语的最大提升分别为 2% 和 10%。

关键词

引用

@article{arxiv.2110.05133,
  title  = {Offensive Language Detection with BERT-based models, By Customizing Attention Probabilities},
  author = {Peyman Alavi and Pouria Nikvand and Mehrnoush Shamsfard},
  journal= {arXiv preprint arXiv:2110.05133},
  year   = {2021}
}