中文

SSCAE——语义、语法与上下文感知的自然语言对抗样本生成器

计算与语言 2024-03-19 v1 密码学与安全 机器学习

摘要

机器学习模型容易受到恶意构造的对抗样本 (AEs) 的攻击。使用 AEs 训练机器学习模型可以提高其对抗抗攻击的鲁棒性和稳定性。开发能够生成高质量 AEs 的模型至关重要。在自然语言处理 (NLP) 领域,此类模型的开发进展远慢于计算机视觉等领域。本文提出了一种实用且高效的对抗攻击模型,称为 SSCAE,即语义、语法与上下文感知的自然语言 AEs 生成器。SSCAE 识别重要单词并使用掩码语言模型生成初始替换集。接下来,采用两个著名的语言模型从语义和语法特征方面评估该初始集合。我们引入了 (1) 一个动态阈值以捕获更高效的扰动,以及 (2) 一种局部贪心搜索以生成高质量 AEs。作为一种黑盒方法,SSCAE 生成人类难以察觉且具备上下文感知的 AEs,同时保持语义一致性并符合源语言的语法和文法要求。通过十五项对比实验和用于参数优化的广泛敏感性分析,阐明了所提出的 SSCAE 模型的有效性和优越性。SSCAE 在所有实验中均优于现有模型,同时保持了更高的语义一致性,且查询次数更少,扰动率相当。

关键词

引用

@article{arxiv.2403.11833,
  title  = {SSCAE -- Semantic, Syntactic, and Context-aware natural language Adversarial Examples generator},
  author = {Javad Rafiei Asl and Mohammad H. Rafiei and Manar Alohaly and Daniel Takabi},
  journal= {arXiv preprint arXiv:2403.11833},
  year   = {2024}
}