基于概念层次的自适应域推断攻击
机器学习
2025-01-28 v3 密码学与安全
摘要
随着深度神经网络在敏感应用领域(如医疗保健和安全)中的部署日益增多,了解可以从这些模型中推断出哪些敏感信息至关重要。大多数已知的模型定向攻击假设攻击者已经学习了应用领域或训练数据分布,以确保攻击成功。从模型API中移除域信息能否保护模型免受这些攻击?本文研究了这一关键问题。不幸的是,即使拥有最少的知识(即作为未命名函数访问模型,而不泄露输入和输出的含义),所提出的自适应域推断攻击(ADI)仍然可以成功估计训练数据的相关子集。我们证明,提取的相关数据可以显著提高,例如,模型反演攻击的性能。具体来说,ADI方法利用从一系列可用的公共和私有数据集中提取的概念层次结构,以及一种新颖算法来自适应地调整叶概念出现在未见训练数据中的可能性。我们还设计了一种基于假设检验的直接攻击——LDI。ADI攻击不仅在概念级别提取部分训练数据,而且在所有候选方法中收敛最快,并且需要最少的目标模型访问次数。我们的代码可在https://anonymous.4open.science/r/KDD-362D获取。
引用
@article{arxiv.2312.15088,
title = {Adaptive Domain Inference Attack with Concept Hierarchy},
author = {Yuechun Gu and Jiajie He and Keke Chen},
journal= {arXiv preprint arXiv:2312.15088},
year = {2025}
}