在离散域中规避分类器并具有可证明最优性保证
机器学习
2019-07-02 v3 密码学与安全
机器学习
摘要
用于机器人、恶意软件或垃圾邮件检测等安全关键应用的机器学习模型在受约束的离散域中运行。这些应用将受益于针对对抗样本的可证明保证。然而,关于模型可证明对抗鲁棒性的现有文献 exclusively 关注于图像等域中对基于梯度的攻击的鲁棒性。这些攻击将对抗代价(例如施加于图像上的失真量)建模为 -范数。我们认为,这种方法不适合对受约束域中的对抗代价建模,因为并非所有样本都可行。我们引入了一个图框架,它(1)推广了离散域中的现有攻击,(2)可容纳超出 -范数的复杂代价函数,包括攻击分类器时产生的经济代价,以及(3)高效地生成具有最小对抗代价保证的有效对抗样本。这些保证直接转化为一种考虑了域约束与 adversary 能力的对抗鲁棒性概念。我们展示了如何利用我们的框架通过构造以可证明最少更改数规避 Twitter 机器人检测分类器的对抗样本来评估安全性;以及通过构造规避侵犯隐私的网站指纹分类器的对抗样本来构建隐私防御。
引用
@article{arxiv.1810.10939,
title = {Evading classifiers in discrete domains with provable optimality guarantees},
author = {Bogdan Kulynych and Jamie Hayes and Nikita Samarin and Carmela Troncoso},
journal= {arXiv preprint arXiv:1810.10939},
year = {2019}
}
备注
NeurIPS 2018 Workshop on Security in Machine Learning