中文

对抗机器学习中攻击强度与可检测性的两难

机器学习 2018-02-22 v1 机器学习

摘要

随着机器学习算法的普及与日常使用,以及我们对其依赖的急剧增长,以恶意意图攻击和破坏这些算法的努力也在增长,导致对抗机器学习兴趣日增。已开发出多种方法,可通过投毒或其他类型攻击使机器学习算法失效。大多数攻击算法通常采用复杂的优化方法,其目标函数旨在相对于某任务上算法的准确率和性能造成最大损害。在本文工作中,我们表明尽管此类目标函数确实在嵌入式特征选择任务上造成最大损害极为有效,但它常导致一种可轻易被极其简单的 novelty 或离群点检测算法发现的攻击机制。然后我们提出一个同样简单而优雅的解法:在攻击者的目标函数中加入惩罚离群攻击点的正则化项。

关键词

引用

@article{arxiv.1802.07295,
  title  = {Attack Strength vs. Detectability Dilemma in Adversarial Machine Learning},
  author = {Christopher Frederickson and Michael Moore and Glenn Dawson and Robi Polikar},
  journal= {arXiv preprint arXiv:1802.07295},
  year   = {2018}
}

备注

8 pages, 9 figures, submitted to IJCNN 2018