评估防御性蒸馏在保护文本处理神经网络对抗对抗样本中的效果
计算与语言
2019-08-22 v1 密码学与安全
机器学习
神经与进化计算
摘要
对抗样本是经过人为修改的输入样本,可导致分类错误,同时人类无法察觉。这些对抗样本对图像和文本分类等许多任务构成挑战,尤其是研究表明许多对抗样本可在不同分类器之间迁移。在本工作中,我们评估了一种流行的对抗样本防御策略——防御性蒸馏的性能,该策略在图像领域可成功增强神经网络抵御对抗样本的能力。然而,我们并非将防御性蒸馏应用于图像分类网络,而是首次检验其在文本分类任务上的表现,并评估其对对抗性文本样本迁移性的影响。我们的结果表明,防御性蒸馏对文本分类神经网络仅有极小的影响,既无助于提高其对抗对抗样本的鲁棒性,也无法阻止对抗样本在神经网络之间的迁移。
引用
@article{arxiv.1908.07899,
title = {Evaluating Defensive Distillation For Defending Text Processing Neural Networks Against Adversarial Examples},
author = {Marcus Soll and Tobias Hinz and Sven Magg and Stefan Wermter},
journal= {arXiv preprint arXiv:1908.07899},
year = {2019}
}
备注
Published at the International Conference on Artificial Neural Networks (ICANN) 2019