基于生成模型的差分隐私事件日志释放
机器学习
2025-04-10 v1 密码学与安全
摘要
近年来,产业界正广泛应用过程矿产和自动化事件数据分析。因此,越来越需要解决与事件数据中包含的敏感和私人信息有关的隐私顾虑。当前研究主要致力于为过程矿产技术所使用的跟踪变体(如过程发现)提供可量化的隐私保证,例如通过差分隐私。然而,针对跟踪变体释放的隐私保护技术仍不足以满足行业规模使用的全部需求。此外,在高频不常见跟踪变体出现的情形下,确保隐私保证仍然具有挑战性。本文引入了两种新方法,用于释放基于训练生成模型的差分隐私跟踪变体。通过TraVaG,我们利用生成对抗网络(GANs)从私有化的隐式变体分布中进行抽样。我们的方法采用去噪扩散概率模型,从噪声通过训练好的马尔可夫链重建人造跟踪变体。两种方法都为行业规模带来了益处,特别是在大量不常见变体出现的情形下,提升了隐私保证的程度。它们克服了常规隐私保护技术的局限性,如限制变体长度并引入虚假变体。针对真实事件数据进行的实验结果表明,我们的方法在隐私保证和实用性保存方面优于当前最先进的技术。
引用
@article{arxiv.2504.06418,
title = {Releasing Differentially Private Event Logs Using Generative Models},
author = {Frederik Wangelik and Majid Rafiei and Mahsa Pourbafrani and Wil M. P. van der Aalst},
journal= {arXiv preprint arXiv:2504.06418},
year = {2025}
}
备注
arXiv admin note: text overlap with arXiv:2303.16704