中文

文本分类中词级对抗样本的检测:基于鲁棒密度估计的基准与基线

计算与语言 2022-03-04 v1 密码学与安全 机器学习

摘要

近年来,词级对抗攻击在 NLP 模型中已显示出成效,大幅降低了基于 transformer 的模型的性能。作为一种对策,对抗防御已被探索,但相对较少的努力用于检测对抗样本。然而,检测对抗样本对于希望收集某一群体信息且同时作为迈向鲁棒防御系统一步的自动化任务(例如评论情感分析)可能至关重要。为此,我们发布了一个涵盖四个数据集、四种模型和四种流行攻击方法的数据集,以鼓励该领域的进一步研究。与此同时,我们提出了一种基于密度估计的具有竞争力的基线,其在 30 种数据集-攻击-模型组合中的 29 种上取得了最高的 AUC。源代码见 https://github.com/anoymous92874838/text-adv-detection。

关键词

引用

@article{arxiv.2203.01677,
  title  = {Detection of Word Adversarial Examples in Text Classification: Benchmark and Baseline via Robust Density Estimation},
  author = {KiYoon Yoo and Jangho Kim and Jiho Jang and Nojun Kwak},
  journal= {arXiv preprint arXiv:2203.01677},
  year   = {2022}
}

备注

Findings of ACL 2022