中文

从含噪损失函数重构测试标签

机器学习 2021-11-02 v2

摘要

机器学习分类器依赖损失函数进行性能评估,通常在私有(隐藏)数据集上。在近期一系列研究中,标签推断被引入作为如下问题:仅从在所选预测向量处评估的(可能受扰动的)交叉熵损失函数值(无任何其他对隐藏数据集的访问)重构该私有数据集的 ground truth 标签。本文正式研究从\emph{任意}(含噪)损失函数值进行标签推断的必要与充分条件。利用解析数论工具,我们证明对一大类常用损失函数(包括基于 Bregman 散度的通用损失,以及带有 sigmoid 和 softmax 等常用激活函数的多类交叉熵),即便在任意噪声水平下且攻击者仅使用单次查询,也可设计成功的标签推断攻击。我们正式研究了标签推断的计算复杂度,并表明尽管一般而言为这些攻击设计对抗预测向量是 co-NP-hard 的,但一旦获得这些向量,攻击也可通过对任何神经网络模型的轻量增强来执行,使其看似良性且难以检测。本文观察增进了对现代机器学习固有漏洞的深入理解,并可用于设计未来可信 ML。

关键词

引用

@article{arxiv.2107.03022,
  title  = {Reconstructing Test Labels from Noisy Loss Functions},
  author = {Abhinav Aggarwal and Shiva Prasad Kasiviswanathan and Zekun Xu and Oluwaseyi Feyisetan and Nathanael Teissier},
  journal= {arXiv preprint arXiv:2107.03022},
  year   = {2021}
}

备注

Accepted at NeurIPS 2021 Workshop on Privacy in Machine Learning (PriML)