无意冒犯,Bert——我只骂人类!面向毒性检测神经网络的多受话者句级攻击
计算与语言
2023-10-23 v1 人工智能
机器学习
摘要
我们提出了一种简单而高效的针对黑盒毒性检测模型的句级攻击方法。通过在仇恨信息末尾添加若干积极词汇或句子,我们能够改变神经网络的预测并绕过毒性检测系统的检查。该方法已被证明在来自三个不同语系的七种语言上均有效。我们还描述了针对上述攻击的防御机制,并讨论了其局限性。
引用
@article{arxiv.2310.13099,
title = {No offence, Bert -- I insult only humans! Multiple addressees sentence-level attack on toxicity detection neural network},
author = {Sergey Berezin and Reza Farahbakhsh and Noel Crespi},
journal= {arXiv preprint arXiv:2310.13099},
year = {2023}
}