网络欺凌分类器对模型无关扰动的敏感性
计算与语言
2022-01-19 v1 计算机与社会
社会与信息网络
摘要
仅有少量研究探讨了模型无关对抗行为在有毒内容分类中的作用。由于毒性分类器主要依赖词汇线索,当当前语料库与最先进模型被部署用于内容审核时,(蓄意的)创造性与演化中的语言使用可能损害其实用性。训练数据越少,模型可能越脆弱。据我们所知,本研究首次探讨了对抗行为与数据增强对网络欺凌检测的影响。我们证明,模型无关的词汇替换会显著损害分类器性能。此外,当这些扰动样本被用于增强时,我们展示模型在面对词级扰动时变得鲁棒,但以整体任务性能轻微下降为代价。先前有毒内容研究提出的增强方法效果较差。我们的结果强调了在具有小规模语料库的在线危害领域进行此类评估的必要性。扰动数据、模型与代码可在 https://github.com/cmry/augtox 获取以复现。
引用
@article{arxiv.2201.06384,
title = {Cyberbullying Classifiers are Sensitive to Model-Agnostic Perturbations},
author = {Chris Emmery and Ákos Kádár and Grzegorz Chrupała and Walter Daelemans},
journal= {arXiv preprint arXiv:2201.06384},
year = {2022}
}
备注
Submitted to LREC 2022