中文

NoisyHate:挖掘在线人工撰写的扰动以对内容审核模型进行真实鲁棒性基准测试

机器学习 2025-04-29 v2 人工智能 计算与语言 计算机与社会

摘要

含有有害内容的在线文本对社交媒体用户乃至整个社会都构成明显威胁。尽管许多平台已采取各种措施(例如基于机器学习的仇恨言论检测系统)来削弱其影响,有害内容撰写者仍试图通过使用巧妙修改的有害词(即所谓人工撰写的文本扰动)来规避此类措施。因此,为帮助构建自动检测工具以识别这些扰动,已有方法开发了复杂技术来生成多样的对抗样本。然而,我们注意到这些“算法”生成的扰动未必能捕捉“人类”撰写扰动的全部特征。因此,本文引入了一个新颖、高质量的人工撰写扰动数据集,命名为 NoisyHate,其来源于由人在回路(human-in-the-loop)撰写并验证的真实扰动。我们表明 NoisyHate 中的扰动具有不同于先前算法生成的有害数据集的特征,因而特别有助于开发更好的有害言论检测方案。我们在扰动归一化与理解两项任务上,针对 BERT、RoBERTa 等最先进语言模型以及 Perspective API 等黑盒 API 对 NoisyHate 进行了充分验证。

关键词

引用

@article{arxiv.2303.10430,
  title  = {NoisyHate: Mining Online Human-Written Perturbations for Realistic Robustness Benchmarking of Content Moderation Models},
  author = {Yiran Ye and Thai Le and Dongwon Lee},
  journal= {arXiv preprint arXiv:2303.10430},
  year   = {2025}
}

备注

Accepted to International AAAI Conference on Web and Social Media (ICWSM 2025)