中文

针对多语言文本分类器的生成对抗攻击

计算与语言 2024-01-17 v1 人工智能

摘要

当前的对抗攻击算法中,攻击者通过修改文本来欺骗受害者模型,已被反复证明对文本分类器有效。然而,这些攻击通常假设受害者模型是单语言的,无法用于针对多语言受害者模型,鉴于这些模型的使用日益增加,这是一个重大局限。因此,在这项工作中,我们提出了一种方法,通过对抗目标微调多语言释义模型,使其能够生成针对多语言分类器的有效对抗样本。训练目标包含一组预训练模型,以确保生成文本的文本质量和语言一致性。此外,所有模型通过词汇映射矩阵适当地连接到生成器,使得整个训练流程实现完全的端到端可微性。在两个多语言数据集和五种语言上的实验验证表明,与现有基线相比,所提方法有效,特别是在查询效率方面。我们还对生成的攻击进行了详细分析,并讨论了未来研究的局限性和机遇。

关键词

引用

@article{arxiv.2401.08255,
  title  = {A Generative Adversarial Attack for Multilingual Text Classifiers},
  author = {Tom Roth and Inigo Jauregi Unanue and Alsharif Abuadbba and Massimo Piccardi},
  journal= {arXiv preprint arXiv:2401.08255},
  year   = {2024}
}

备注

AAAI-24 Workshop on Artificial Intelligence for Cyber Security (AICS)