中文

并非所有数据集生而平等:论异构数据与对抗样本

机器学习 2021-09-03 v2 密码学与安全

摘要

近期关于对抗学习的研究主要聚焦于神经网络及其擅长的领域,如计算机视觉或音频处理。这些领域的数据通常是同质的,而异构表格数据领域尽管普遍存在,却仍未被充分探索。在异构输入空间中搜索对抗模式时,攻击者必须同时保持数据复杂的领域特定有效性规则,以及所识别样本的对抗性质。因此,对异构数据集施加对抗扰动已被证明是一项具有挑战性的任务,且迄今未提出通用攻击方法。然而,我们认为在异构表格数据上训练的机器学习模型与在图像等连续或同质数据上训练的模型一样,易受对抗操纵。为支持我们的主张,我们引入了一种用于识别异构输入空间中对抗扰动的通用优化框架。我们定义了保持对抗样本一致性的分布感知约束,并通过将异构输入嵌入连续潜空间来纳入这些约束。由于底层数据集的性质,我们聚焦于 0\ell_0 扰动,并展示其在现实中的适用性。我们使用来自不同内容领域的三个数据集证明了方法的有效性。结果表明,尽管异构数据集对输入有效性施加了约束,使用此类数据训练的机器学习模型仍同样易受对抗样本影响。

关键词

引用

@article{arxiv.2010.03180,
  title  = {Not All Datasets Are Born Equal: On Heterogeneous Data and Adversarial Examples},
  author = {Yael Mathov and Eden Levy and Ziv Katzir and Asaf Shabtai and Yuval Elovici},
  journal= {arXiv preprint arXiv:2010.03180},
  year   = {2021}
}