中文

迈向鲁棒的有害内容分类

计算与语言 2019-12-17 v1

摘要

有害内容检测旨在识别可能冒犯或伤害接收者的内容。有害内容的自动分类器需要对蓄意绕过过滤器的对抗者保持鲁棒。我们提出一种利用有害词元词典生成逼真且模型无关的攻击的方法,该方法试图通过字符级扰动混淆有害词元,或注入无毒干扰词元,来稀释毒性信号以误导毒性分类器。我们表明这些逼真攻击在某些情形下使包括使用 ELMo 和 BERT 在内的 SOTA 神经毒性检测器的检测召回率降低超过 50%。我们探索了两种防御此类攻击的方法。首先,我们考察在合成加噪数据上训练的效果。其次,我们提出上下文去噪自编码器(CDAE):一种利用字符级与上下文信息对扰动词元去噪以学习鲁棒表示的方法。我们表明这两种方法互补,提升了对字符级扰动与干扰词元的鲁棒性,恢复了相当部分损失的精度。最后,我们分析了最具竞争力方法的鲁棒性特征,并概述了改进毒性检测器的实际考量。

关键词

引用

@article{arxiv.1912.06872,
  title  = {Towards Robust Toxic Content Classification},
  author = {Keita Kurita and Anna Belova and Antonios Anastasopoulos},
  journal= {arXiv preprint arXiv:1912.06872},
  year   = {2019}
}

备注

to appear at EDSMLS 2020