从分类器推断训练数据的类标签分布:一种精度增强的元分类器攻击
机器学习
2022-11-09 v1 人工智能
密码学与安全
摘要
针对机器学习(ML)模型的属性推断攻击旨在推断与模型主要任务无关的的训练数据属性,迄今为止被表述为二元决策问题,即训练数据是否具有某属性。然而,在工业和医疗应用中,训练数据中标签的比例也常被视为敏感信息。在本文中,我们引入一种新型属性推断攻击,与文献中的二元决策问题不同,其旨在从ML分类器模型的参数推断训练数据的类标签分布。我们提出一种基于\emph{影子训练}和在一个\emph{元分类器}上的方法,该元分类器训练于影子分类器的参数,并辅以分类器在辅助数据上的精度。我们针对具有全连接神经网络架构的ML分类器评估所提方法。我们发现所提出的\emph{元分类器}攻击相较最先进技术提供了最大的相对提升。
引用
@article{arxiv.2211.04157,
title = {Inferring Class Label Distribution of Training Data from Classifiers: An Accuracy-Augmented Meta-Classifier Attack},
author = {Raksha Ramakrishna and György Dán},
journal= {arXiv preprint arXiv:2211.04157},
year = {2022}
}
备注
12 pages, 2022 Trustworthy and Socially Responsible Machine Learning (TSRML 2022) co-located with NeurIPS 2022