中文

面向安全分类器的自动对抗发现

计算与语言 2024-06-26 v1

摘要

安全分类器在缓解社交媒体和聊天机器人中的有害内容方面至关重要,但仍然容易受到新兴且往往不可数的一类对抗攻击的威胁。然而,传统的自动化对抗数据生成方法倾向于产生缺乏多样性的攻击,这些攻击只是之前观察到的有害类型变体。我们正式化了自动化对抗发现任务用于安全分类器——寻找沿以前未见的有害维度的新攻击,以暴露分类器的新弱点。我们沿两个关键轴向衡量进度:(1)对抗成功:攻击是否骗过分类器?(2)维度多样性:攻击是否代表以前未见的有害类型?我们对现有攻击生成方法在CivilComments毒性任务上的评估揭示了其局限性:单词扰动攻击未能骗过分类器,而基于提示的LLM攻击在对抗成功方面更好,但缺乏维度多样性。即使我们最好的基于提示的方法仅在5%的情况下找到新的在未见有害攻击维度上的新成功攻击。自动发现有害攻击维度至关重要,而我们当前任务上仍有显著的提升空间。

关键词

引用

@article{arxiv.2406.17104,
  title  = {Automated Adversarial Discovery for Safety Classifiers},
  author = {Yash Kumar Lal and Preethi Lahoti and Aradhana Sinha and Yao Qin and Ananth Balashankar},
  journal= {arXiv preprint arXiv:2406.17104},
  year   = {2024}
}

备注

Published at Fourth Workshop on TrustworthyNLP (TrustNLP) at NAACL 2024