中文

TaeBench: 提升有毒对抗样本的质量

密码学与安全 2025-05-02 v2 人工智能 计算与语言 机器学习

摘要

毒性文本检测器可能容易受到对抗样本的攻击——即对输入文本进行微小扰动,从而欺骗系统使其做出错误检测。现有的攻击算法耗时且常常产生无效或模棱两可的对抗样本,这使得它们在评估或改进现实世界的毒性内容审核器方面效果不佳。本文提出了一种用于生成的有毒对抗样本(TAE)质量控制的标注流程。我们设计了基于模型的自动标注和基于人工的质量验证来评估TAE的质量要求。成功的TAE应能欺骗目标毒性模型做出良性预测,语法合理,看起来像人类生成的文本一样自然,并表现出语义毒性。当将这些要求应用于超过20种最先进的TAE攻击方法时,我们从总共94万个原始TAE攻击生成中发现了许多无效样本。然后,我们利用所提出的流程来过滤和整理出一个高质量的TAE数据集,我们称之为TaeBench(大小为26.4万)。实验表明,TaeBench能够有效地对最先进的毒性内容审核模型和服务进行迁移攻击。我们的实验还表明,使用TaeBench进行对抗训练能显著提升两个毒性检测器的鲁棒性。

关键词

引用

@article{arxiv.2410.05573,
  title  = {TaeBench: Improving Quality of Toxic Adversarial Examples},
  author = {Xuan Zhu and Dmitriy Bespalov and Liwen You and Ninad Kulkarni and Yanjun Qi},
  journal= {arXiv preprint arXiv:2410.05573},
  year   = {2025}
}

备注

Accepted for publication in NAACL 2025. The official version will be available in the ACL Anthology