习得表征与影响函数能揭示关于对抗样本的哪些信息
机器学习
2023-10-11 v3 计算与语言
摘要
对抗样本是通过微小扰动精心构造以欺骗深度神经网络的数据,最早在图像处理中被研究,近年来也在自然语言处理(NLP)中受到关注。尽管 NLP 中检测对抗样本的方法主要依赖于对输入扰动的搜索,图像处理领域已出现一系列旨在刻画习得表征上对抗子空间的技术。本文将上述两类方法适配到 NLP 中:一种基于最近邻与影响函数,另一种基于马氏距离。其中前者在与多个强基线对比时产生了最先进的检测器;此外,影响函数的新颖使用揭示了 NLP 中对抗样本子空间与图像处理中的关联方式,以及它们如何因 NLP 任务类型不同而存在差异。
引用
@article{arxiv.2309.10916,
title = {What Learned Representations and Influence Functions Can Tell Us About Adversarial Examples},
author = {Shakila Mahjabin Tonni and Mark Dras},
journal= {arXiv preprint arXiv:2309.10916},
year = {2023}
}
备注
20 pages, Accepted in IJCNLP_AACL 2023