中文

VertAttack:利用文本分类器的横向视觉

计算与语言 2024-04-15 v1

摘要

多年来,文本分类系统的性能不断提升。然而,当前几乎所有 SOTA 分类器都有一个共同的缺点:它们以横向方式处理文本。分类器无法识别纵向书写的词汇。相比之下,人类能够轻松识别和阅读横向与纵向书写的词汇。因此,人类攻击者可以将有问题的词汇纵向书写,而其含义对其他人类依然保留。我们模拟了这样一种攻击,VertAttack。VertAttack 识别分类器所依赖的词汇,然后将这些词汇纵向重写。我们发现,VertAttack 能够大幅降低 4 个不同的 Transformer 模型在 5 个数据集上的准确率。例如,在 SST2 数据集上,VertAttack 将 RoBERTa 的准确率从 94% 降至 13%。此外,由于 VertAttack 不替换词汇,其含义得以轻松保留。我们通过一项人类研究验证了这一点,发现众包工人能够对 77% 的扰动文本进行正确标注,而原始文本的正确标注率为 81%。我们相信,VertAttack 展示了人类未来可能如何规避分类器,从而启发对更鲁棒算法的研究。

关键词

引用

@article{arxiv.2404.08538,
  title  = {VertAttack: Taking advantage of Text Classifiers' horizontal vision},
  author = {Jonathan Rusert},
  journal= {arXiv preprint arXiv:2404.08538},
  year   = {2024}
}

备注

14 pages, 4 figures, accepted to NAACL 2024