中文

基于博弈的深度神经网络近似验证及其可证明保证

机器学习 2020-04-07 v2 人工智能 机器学习

摘要

尽管深度神经网络的精度有所提高,但对抗样本的发现引发了严重的安全担忧。在本文中,我们研究两类逐点鲁棒性变体:最大安全半径问题,即给定输入样本计算到对抗样本的最小距离;以及特征鲁棒性问题,旨在量化个体特征对对抗扰动的鲁棒性。我们证明,在 Lipschitz 连续性假设下,这两个问题均可通过离散化输入空间利用有限优化来近似,且该近似具有可证明的保证,即误差有界。我们进一步表明,所得的优化问题可归约为两人轮流博弈的求解,其中第一名玩家选择特征,第二名玩家在特征内扰动图像。虽然第二名玩家旨在最小化到对抗样本的距离,但根据优化目标,第一名玩家可以是协作的或竞争的。我们采用一种随时(anytime)方法来求解博弈,即通过单调改进博弈的上界和下界来近似博弈值。蒙特卡洛树搜索算法用于计算两个博弈的上界,而可采纳 A* 算法和 Alpha-Beta 剪枝算法分别用于计算最大安全半径博弈和特征鲁棒性博弈的下界。在处理最大安全半径问题的上界时,我们的工具相对于现有对抗样本生成算法展现出有竞争力的性能。此外,我们展示了我们的框架如何部署于评估安全关键应用(如自动驾驶汽车中的交通标志识别)中神经网络的逐点鲁棒性。

关键词

引用

@article{arxiv.1807.03571,
  title  = {A Game-Based Approximate Verification of Deep Neural Networks with Provable Guarantees},
  author = {Min Wu and Matthew Wicker and Wenjie Ruan and Xiaowei Huang and Marta Kwiatkowska},
  journal= {arXiv preprint arXiv:1807.03571},
  year   = {2020}
}