中文

利用 HateXplain 与 BERT 探索仇恨言论检测

计算与语言 2022-08-10 v1

摘要

仇恨言论以多种形式针对群体发表贬损性评论,使人类社会进步倒退一步。HateXplain 是近期发布的、首个以理由标注片段形式,结合言论分类类别与针对群体,使分类更具类人性、可解释性、准确性且偏差更小的数据集。我们微调 BERT 以理由与类别预测的形式执行该任务,并在涵盖准确性、可解释性与偏差的多种指标上比较性能。我们的创新有三方面。首先,我们尝试了具有不同重要性值的合并理由-类别损失。其次,我们广泛实验了理由的真实注意力值。通过引入保守与宽松注意力,我们在 HateXplain 上比较模型性能并验证假设。第三,为改善模型中的非预期偏差,我们对目标群体词进行掩码,并记录了偏差与可解释性指标的改善。总体而言,我们成功实现了模型可解释性、偏差消除以及对原始 BERT 实现的若干增量改进。

关键词

引用

@article{arxiv.2208.04489,
  title  = {Exploring Hate Speech Detection with HateXplain and BERT},
  author = {Arvind Subramaniam and Aryan Mehra and Sayani Kundu},
  journal= {arXiv preprint arXiv:2208.04489},
  year   = {2022}
}

备注

arXiv admin note: text overlap with arXiv:2012.10289 by other authors