学习具有可验证全局鲁棒性性质的安全分类器
密码学与安全
2021-12-03 v3 机器学习
摘要
许多近期工作提出了训练具有局部鲁棒性性质分类器的方法,这些方法可以为大多数(而非全部)输入可证明地消除一类规避攻击。由于数据分布偏移在安全应用中非常常见(例如,在恶意软件检测中经常观察到),局部鲁棒性无法保证在部署分类器时该性质对未见输入成立。因此,更可取的是强制对所有输入成立的全局鲁棒性性质,这严格强于局部鲁棒性。在本文中,我们提出了一个用于训练满足全局鲁棒性性质分类器的框架与工具。我们定义了更适合安全分类器的全局鲁棒性新概念。我们设计了一种新颖的增强-修复训练框架来强制全局鲁棒性性质。我们将分类器构造为逻辑规则的集成,并设计了一个新的验证器来验证这些性质。在我们的训练算法中,增强器提升分类器的容量,修复器遵循反例引导的归纳综合来强制已验证的全局鲁棒性性质。我们展示了可以针对三个安全数据集训练分类器以满足不同的全局鲁棒性性质,甚至同时满足多个性质,且对分类器性能影响有限。例如,我们训练了一个 Twitter 垃圾账号分类器以满足五个全局鲁棒性性质,与不满足任何性质的基线 XGBoost 模型相比,真正率下降 5.4%,假正率上升 0.1%。
引用
@article{arxiv.2105.11363,
title = {Learning Security Classifiers with Verified Global Robustness Properties},
author = {Yizheng Chen and Shiqi Wang and Yue Qin and Xiaojing Liao and Suman Jana and David Wagner},
journal= {arXiv preprint arXiv:2105.11363},
year = {2021}
}
备注
ACM Conference on Computer and Communications Security (CCS) 2021 Best Paper Award Runner-Up