面向文本对抗样本的构造
机器学习
2017-07-11 v1 人工智能
计算与语言
计算机视觉与模式识别
摘要
对抗样本是为欺骗当前分类器而有策略地修改过的样本。攻击者向已部署的分类器引入专门构造的对抗样本,这些样本被分类器错误分类。然而,这些样本被感知为完全来自不同的类别,因此难以检测对抗样本。先前大多数工作集中于在图像领域合成对抗样本。在本文中,我们提出一种通过修改原始样本来构造对抗文本样本的新方法。对原始文本样本的修改通过删除或替换文本中重要或显著词语,或在文本样本中引入新词来完成。我们的算法在每类样本中包含子类别的数据集上表现最佳。在构造对抗样本时,一个关键约束是生成有意义的句子,从语言(英语)视角看能作为合法句子蒙混过关。在用于情感分析的 IMDB 影评数据集和用于性别检测的 Twitter 数据集上的实验结果展示了我们提出方法的效率。
引用
@article{arxiv.1707.02812,
title = {Towards Crafting Text Adversarial Samples},
author = {Suranjana Samanta and Sameep Mehta},
journal= {arXiv preprint arXiv:1707.02812},
year = {2017}
}
备注
11 pages, 5 figues