中文

BAN 还是不 BAN:用于可靠仇恨言论检测的贝叶斯注意力网络

应用统计 2020-12-18 v7 机器学习

摘要

仇恨言论是用户生成内容管理中的一个重要问题。为移除攻击性内容或封禁行为不当的用户,内容审核员需要可靠的仇恨言论检测器。近来,基于 transformer 架构的深度神经网络,如(多语)BERT 模型,在许多自然语言分类任务(包括仇恨言论检测)中取得优越性能。迄今,这些方法尚无法以可靠性量化其输出。我们提出一种贝叶斯方法,在 transformer 模型的注意力层中使用 Monte Carlo dropout 以提供良好校准的可靠性估计。我们在多种语言的仇恨言论检测问题上评估并可视化所提方法的结果。此外,我们测试情感维度是否能增强 BERT 模型在仇恨言论分类中提取的信息。实验表明 Monte Carlo dropout 为 transformer 网络中的可靠性估计提供了可行机制。将其用于 BERT 模型时,它提供了最先进的分类性能并能检测可信度较低的预测。同时观察到,使用 sentic computing 方法提取的情感维度可有助于理解仇恨言论所涉情绪的解读。我们的方法不仅提升了最先进多语 BERT 模型的分类性能,所计算的可靠性分数也显著减少了攻击性案例核查与重新标注工作中的工作量。所提供的可视化有助于理解边界结果。

关键词

引用

@article{arxiv.2007.05304,
  title  = {To BAN or not to BAN: Bayesian Attention Networks for Reliable Hate Speech Detection},
  author = {Kristian Miok and Blaz Skrlj and Daniela Zaharie and Marko Robnik-Sikonja},
  journal= {arXiv preprint arXiv:2007.05304},
  year   = {2020}
}