从模型解释中重构模型
机器学习
2018-07-16 v1 机器学习
摘要
我们通过理论与实验表明,基于梯度的模型解释会迅速暴露模型本身。我们的结果揭示了将专有模型保密的诉求与提供模型解释的能力之间的张力。在理论方面,我们给出一种算法,在算法可查询模型相对于所选输入的梯度的设定下,可证明地学习一个两层 ReLU 网络。查询次数与维度无关,且在对模型规模的依赖上近乎最优。这不仅从学习理论视角引人关注,也凸显了梯度而非标签作为学习基元的能力。作为理论的补充,我们给出了从梯度解释中重构模型的有效启发式方法,其查询效率比较依赖预测接口的重构攻击高出数个数量级。
引用
@article{arxiv.1807.05185,
title = {Model Reconstruction from Model Explanations},
author = {Smitha Milli and Ludwig Schmidt and Anca D. Dragan and Moritz Hardt},
journal= {arXiv preprint arXiv:1807.05185},
year = {2018}
}