中文

VoteTRANS:通过对变换的硬标签投票在无训练情况下检测对抗文本

计算与语言 2023-06-05 v1

摘要

对抗攻击揭示了深度学习模型中存在的严重缺陷。更危险的是,这些攻击保留了原始语义并逃过了人类的识别。现有的检测这些攻击的方法需要使用原始/对抗数据进行训练。在本文中,我们提出通过对变换预测的硬标签进行投票来实现无训练检测,即 VoteTRANS。具体而言,VoteTRANS 通过比较输入文本及其变换的硬标签来检测对抗文本。评估表明,VoteTRANS 在多种最先进的攻击、模型和数据集上有效地检测了对抗文本。

关键词

引用

@article{arxiv.2306.01273,
  title  = {VoteTRANS: Detecting Adversarial Text without Training by Voting on Hard Labels of Transformations},
  author = {Hoang-Quoc Nguyen-Son and Seira Hidano and Kazuhide Fukushima and Shinsaku Kiyomoto and Isao Echizen},
  journal= {arXiv preprint arXiv:2306.01273},
  year   = {2023}
}

备注

Findings of ACL 2023 (long paper)