TCAB:大规模文本分类攻击基准
机器学习
2022-10-25 v1
摘要
我们介绍了文本分类攻击基准(TCAB),一个用于分析、理解、检测和标注针对文本分类器的对抗攻击的数据集。TCAB包含150万条攻击实例,由十二种对抗攻击生成,这些攻击针对在六个英文情感分析与滥用检测源数据集上训练的三个分类器。与标准文本分类不同,文本攻击必须在被攻击的目标分类器的语境下理解,因此目标分类器的特征同样重要。TCAB包含所有成功翻转预测标签的攻击实例;其中一部分攻击还由人工标注者标注,以确定主要语义被保留的频率。攻击生成过程自动化,因此TCAB可轻松扩展以纳入新出现的文本攻击和更优分类器。除检测和标注攻击的主要任务外,TCAB还可用于攻击定位、攻击目标标注和攻击表征。TCAB代码与数据集可在 https://react-nlp.github.io/tcab/ 获取。
引用
@article{arxiv.2210.12233,
title = {TCAB: A Large-Scale Text Classification Attack Benchmark},
author = {Kalyani Asthana and Zhouhang Xie and Wencong You and Adam Noack and Jonathan Brophy and Sameer Singh and Daniel Lowd},
journal= {arXiv preprint arXiv:2210.12233},
year = {2022}
}
备注
32 pages, 7 figures, and 14 tables