利用深度生成模型生成隐私保护的过程数据
机器学习
2022-03-16 v1 人工智能
密码学与安全
摘要
含有机密信息的过程数据无法在公开场合直接共享,这阻碍了过程数据挖掘与分析的研究。数据加密方法已被研究用于保护数据,但其仍可能被解密,从而导致个体身份识别。我们尝试了不同的表示学习模型,并利用所学模型生成合成过程数据。我们引入了用于过程数据生成的对抗生成网络(ProcessGAN),其生成器与判别器采用两个 Transformer 网络。我们在六个真实数据集上评估了 ProcessGAN 与传统模型,其中两个为公开数据,四个采集自医疗领域。我们使用统计指标与监督学习分数评估合成数据。我们还通过过程挖掘为真实与合成数据集发现工作流,并请医学专家评估合成工作流的临床适用性。我们发现,在复杂过程的小规模真实数据集上训练时,ProcessGAN 优于传统序列模型。ProcessGAN 更好地表示了活动间的长程依赖,这对医疗过程等复杂过程十分重要。传统序列模型在大规模简单过程数据上训练时表现更好。我们得出结论:ProcessGAN 能够生成大量可共享的、与真实数据难以区分的合成过程数据。
引用
@article{arxiv.2203.07949,
title = {Generating Privacy-Preserving Process Data with Deep Generative Models},
author = {Keyi Li and Sen Yang and Travis M. Sullivan and Randall S. Burd and Ivan Marsic},
journal= {arXiv preprint arXiv:2203.07949},
year = {2022}
}
备注
9 pages, 6 figures