中文

面向零样本仇恨言论检测的错误假设工程

计算与语言 2022-10-04 v1

摘要

标准的仇恨言论检测方法依赖于充足可用的仇恨言论标注。在先前将自然语言推理(NLI)模型改造用于零样本文本分类的工作基础上,我们提出一种简单方法,通过组合多个假设来改进基于英文 NLI 的零样本仇恨言论检测。我们首先对基于原始 NLI 的零样本仇恨言论检测进行错误分析,然后基于该分析开发了四种策略。这些策略使用多个假设来预测输入文本的各个方面,并将这些预测组合为最终判定。我们发现,用于初始错误分析的零样本基线在 HateCheck 上已经优于商业系统和微调的基于 BERT 的仇恨言论检测模型。所提策略的组合进一步将 HateCheck 上 79.4% 的零样本准确率提升了 7.9 个百分点(pp),并将 ETHOS 上 69.6% 的准确率提升了 10.0 个百分点。

关键词

引用

@article{arxiv.2210.00910,
  title  = {Hypothesis Engineering for Zero-Shot Hate Speech Detection},
  author = {Janis Goldzycher and Gerold Schneider},
  journal= {arXiv preprint arXiv:2210.00910},
  year   = {2022}
}

备注

Third Workshop on Threat, Aggression and Cyberbullying (COLING 2022)