中文

分类器中数据足迹:理解隐私风险与解决方案策略

密码学与安全 2025-04-15 v2 人工智能

摘要

人工智能(AI)在政府和私营部门的广泛部署带来了进步,同时也带来了更高的隐私和安全担忧。欧盟通用数据保护条例(GDPR)第17条要求实施数据遗忘权力,要求数据从系统中永久删除,以防止潜在的安全风险。虽然现有研究主要关注擦除敏感数据属性,但仍有一些被动的数据泄露机制未得到探索和解决。一种这样的问题是,训练数据残留足迹嵌入到预测模型中。在测试数据和训练数据之间的性能差异可能会不小心地揭示哪些数据点是训练集的一部分,从而构成隐私风险。本研究examines 分类器系统的两个根本方面——训练数据质量和分类器训练方法——如何 contribute to 隐私漏洞。我们的理论分析表明,在数据不平衡和分布迁移条件下,分类器会 exhibit universal 漏洞。实证研究结果强化了我们的理论结果,突显了训练数据质量在分类器易受性方面的重要作用。此外,我们的研究还揭示了分类器的运行机制和架构设计会影响其易受性。我们进一步通过数据隐私技术来探索缓解措施,并分析其对隐私和分类性能的影响。为了帮助实践者,我们引入了一个隐私-性能权衡指数,提供了一种结构化方法来平衡隐私保护与模型效果。我们的发现为在各种实际应用中选择分类器和策划训练数据提供了宝贵的见解。

关键词

引用

@article{arxiv.2407.02268,
  title  = {Footprints of Data in a Classifier: Understanding the Privacy Risks and Solution Strategies},
  author = {Payel Sadhukhan and Tanujit Chakraborty},
  journal= {arXiv preprint arXiv:2407.02268},
  year   = {2025}
}