通过扰动潜在表示进行文本分类对抗样本
机器学习
2024-05-08 v1 人工智能
计算与语言
密码学与安全
摘要
最近,随着深度学习的发展,文本分类的多个应用取得了显著进展。然而,这一改进伴随着深层网络对对抗样本脆弱的代价。这种弱点表明深度学习并不十分稳健。幸运的是,文本分类器的输入是离散的,因此可以防止来自 state-of-the-art 攻击的分类器。尽管如此,之前的工作仍生成成功操纵输入离散值的黑盒攻击,以找到对抗样本。因此,我们通过将输入转换为包含实值的嵌入向量来执行最先进的白盒攻击,然后将扰动后的嵌入向量转换回文本,并将其命名为对抗样本。总结来说,我们创建一个测量文本分类器鲁棒性的框架,利用分类器的梯度。
引用
@article{arxiv.2405.03789,
title = {On Adversarial Examples for Text Classification by Perturbing Latent Representations},
author = {Korn Sooksatra and Bikram Khanal and Pablo Rivas},
journal= {arXiv preprint arXiv:2405.03789},
year = {2024}
}
备注
7 pages