学习攻击:揭示顺序数据释放中的隐私风险
密码学与安全
2025-10-30 v1 机器学习
摘要
隐私问题在现代AI和数据科学应用中日益突出,敏感信息被收集、分析和在医疗、金融和 mobility 等不同领域之间共享。虽然先前的研究聚焦于单次数据释放的隐私保护,但许多真实世界系统是在顺序或持续的数据发布下运作,其中相同或相关数据在时间上不断释放。这种顺序披露引入了新的漏洞,由于跨释放的时序相关性,可能使对手推断出在任何单个释放中保持隐藏的敏感信息。在本文中,我们调查了攻击者是否可以通过利用连续出版物之间的依赖关系来破坏顺序数据释放中的隐私,即使每个单独的释放满足标准隐私保证。为此,我们提出了一种新型攻击模型,通过将隐藏马尔可夫模型与强化学习基于双向推断机制集成来捕获这些顺序依赖。这使攻击者能够利用序列中的早期和后期观察来推断私人信息。我们在轨迹数据上下文中实现了我们的框架,展示了对手如何从顺序 mobility 数据集中恢复敏感位置。针对 Geolife、Porto Taxi 和 SynMob 数据集进行的大量实验表明,我们的方法在处理每个释放独立的基线方法时 consistently 优于它们。结果揭示了顺序数据发布固有的基本隐私风险,尽管单个受保护的释放在各自独立时是安全的,但在进行时序分析时会泄露敏感信息。这些发现凸显了需要新的隐私保护框架的需求,这些框架显式地建模时序依赖,例如时序感知差分隐私或顺序数据混淆策略。
引用
@article{arxiv.2510.24807,
title = {Learning to Attack: Uncovering Privacy Risks in Sequential Data Releases},
author = {Ziyao Cui and Minxing Zhang and Jian Pei},
journal= {arXiv preprint arXiv:2510.24807},
year = {2025}
}