跨流关联存活合成:衡量合成网络痕迹中的源级隐私泄露
密码学与安全
2026-05-11 v2 网络与互联网体系结构
摘要
合成网络数据生成器(SynNetGens)日益增多地用于在不暴露敏感原始数据的情况下共享逼真的流量痕迹。尽管努力不断提高保真度,但隐私要么被假定为综合的内在属性,要么通过在数据包或流层面应用差分隐私来解决。本文揭示了一种根本性隐私漏洞:SynNetGens保留跨流行为相关性,这些相关性暴露了源级成员身份,允许攻击者确定特定用户或服务的流量是否包含在训练数据中。这种泄露源于抽象层次的不匹配:现有的SynNetGens在数据包或流层面运行并受到保护,而敏感信息则编码在来自同一源的流之间的相关性中。为证明该漏洞在实际中是可被利用的,我们开发了TraceBleed,这是首个针对黑盒SynNetGens的源级成员推断攻击。我们的评估覆盖了五个数据集和六个SynNetGens,结果显示:(i)每个生成器在至少一些数据集上都泄露源级信息;(ii)数据包或流层面的差分隐私无法在保真度降低到不可用水平之前保护源隐私;(iii)释放10倍更多的合成数据会使泄露平均增加130%。为支持该领域的持续研究,我们将维护一个公开的隐私-保真度排行榜,以便实践者选择符合自身需求的生成器,并让研究人员能够对新设计进行可靠的基准测试。
引用
@article{arxiv.2508.11742,
title = {Cross-Flow Correlations Survive Synthesis: Measuring Source-Level Privacy Leakage in Synthetic Network Traces},
author = {Minhao Jin and Hongyu Hè and Maria Apostolaki},
journal= {arXiv preprint arXiv:2508.11742},
year = {2026}
}