中文

在对抗性草堆中寻找针:一种以最小分布扭曲发现边缘案例的靶向改写方法

计算与语言 2024-02-06 v2

摘要

针对语言模型的对抗性攻击是一个重要问题。具体而言,对抗样本利用了模型对输入微小变化的敏感性。虽然这些变化对输入样本的语义而言看似微不足道,却会导致模型性能显著下降。本文提出基于强化学习的靶向改写(TPRL),一种自动学习策略以生成最有可能提升模型性能的挑战性样本的方法。TPRL 以语言模型 FLAN T5 作为生成器,并采用基于近端策略梯度的自学习策略自动生成对抗样本。TPRL 的奖励基于分类器中诱导的混淆,并通过互蕴含分数保持原始文本含义。我们通过在四个不同 NLP 分类任务上的大量实验,经由自动评估与人工评估,展示并评估了 TPRL 在发现自然对抗攻击和提升模型性能方面的有效性。TPRL 优于强基线,在分类器和数据集上展现出泛化能力,并结合了语言建模与强化学习的优势以生成多样且有影响力的对抗样本。

关键词

引用

@article{arxiv.2401.11373,
  title  = {Finding a Needle in the Adversarial Haystack: A Targeted Paraphrasing Approach For Uncovering Edge Cases with Minimal Distribution Distortion},
  author = {Aly M. Kassem and Sherif Saad},
  journal= {arXiv preprint arXiv:2401.11373},
  year   = {2024}
}

备注

EACL 2024 - Main conference - Camera ready version