中文

只需一词之变:利用大语言模型为文本分类器创建合成训练样本

计算与语言 2025-07-15 v3

摘要

在文本分类中,创建对抗样本意味着在不改变句子含义的情况下,巧妙地扰动句子中的几个词,使其被分类器错误分类。一个令人担忧的观察是,现有方法生成的对抗样本中有很大一部分只改变了一个词。这种单字扰动漏洞代表了分类器的一个重大弱点,恶意用户可以利用它高效地创建大量对抗样本。本文研究了这个问题,并做出了以下关键贡献:(1)我们引入了一个新的度量指标ρ,用于定量评估分类器对单字扰动的鲁棒性。(2)我们提出了SP-Attack,旨在利用单字扰动漏洞,与最先进的对抗方法相比,实现了更高的攻击成功率,更好地保留了句子含义,同时降低了计算成本。(3)我们提出了SP-Defense,旨在通过学习中的数据增强来提高ρ。在4个数据集以及BERT和distilBERT分类器上的实验结果表明,SP-Defense在两个分类器上分别将ρ提高了14.6%和13.9%,并将SP-Attack的攻击成功率分别降低了30.4%和21.2%,同时也降低了涉及多词扰动的现有攻击方法的攻击成功率。

关键词

引用

@article{arxiv.2401.17196,
  title  = {Single Word Change is All You Need: Using LLMs to Create Synthetic Training Examples for Text Classifiers},
  author = {Lei Xu and Sarah Alnegheimish and Laure Berti-Equille and Alfredo Cuesta-Infante and Kalyan Veeramachaneni},
  journal= {arXiv preprint arXiv:2401.17196},
  year   = {2025}
}