中文

SS-BERT:利用“主观性”与“身份术语”概念缓解有毒评论分类中的身份术语偏差

计算与语言 2022-10-18 v1 人工智能 机器学习

摘要

有毒评论分类模型常被发现有偏向身份术语的偏差,身份术语是刻画特定人群(如“穆斯林”和“黑人”)的词汇。此类偏差通常表现为假阳性预测,即含有身份术语的无毒评论被误判为有毒。本文提出一种新方法,利用评论的主观性程度以及身份术语的出现来应对有毒评论分类中的此类偏差。我们假设,当一条评论针对由身份术语刻画的群体时,该评论有毒的可能性与评论的主观性程度(即评论表达个人感受与意见的程度)相关。在 BERT 模型基础上,我们提出一种能够利用这些特征的新结构,并在 4 个规模不同、代表不同社交媒体平台的数据集上对我们的模型进行了充分评估。结果表明,我们的模型能持续优于 BERT 以及一种以不同方式解决身份术语偏差的 SOTA 模型,其 F1 值分别最高提升 2.43% 和 1.91%。

关键词

引用

@article{arxiv.2109.02691,
  title  = {SS-BERT: Mitigating Identity Terms Bias in Toxic Comment Classification by Utilising the Notion of "Subjectivity" and "Identity Terms"},
  author = {Zhixue Zhao and Ziqi Zhang and Frank Hopfgartner},
  journal= {arXiv preprint arXiv:2109.02691},
  year   = {2022}
}

备注

12 pages, 6 tables, 3 figures