中文

构建鲁棒毒性预测器

计算与语言 2024-04-16 v1 人工智能 密码学与安全 机器学习

摘要

最近的NLP文献很少关注毒性语言预测器的鲁棒性,而这些系统最有可能在对抗性环境中使用。本文提出了一种新颖的对抗性攻击方法\texttt{ToxicTrap},通过引入小的词级扰动来欺骗最先进的文本分类器,将毒性文本样本预测为良性。ToxicTrap利用基于贪心的搜索策略,能够快速有效地生成毒性对抗样本。两种新颖的目标函数设计使ToxicTrap能够识别多类和多标签毒性语言检测器中的弱点。我们的实证结果表明,最先进的毒性文本分类器确实容易受到所提出的攻击,在多标签情况下攻击成功率超过98%。我们还展示了普通对抗训练及其改进版本如何帮助提高毒性检测器的鲁棒性,即使面对未见过的攻击。

关键词

引用

@article{arxiv.2404.08690,
  title  = {Towards Building a Robust Toxicity Predictor},
  author = {Dmitriy Bespalov and Sourav Bhabesh and Yi Xiang and Liutong Zhou and Yanjun Qi},
  journal= {arXiv preprint arXiv:2404.08690},
  year   = {2024}
}

备注

ACL 2023 /