深度学习基于轨迹生成的差分隐私代价是什么?
密码学与安全
2025-06-12 v1 机器学习
摘要
虽然位置轨迹提供了宝贵的洞察,但也揭示了敏感个人信息。差分隐私 (DP) 提供了形式化保护,但实现可接受的 utility-privacy 折衷仍具有挑战性。近期研究探索深度学习生成模型以产生合成轨迹,但当前模型缺乏形式化隐私保证,且依赖于来自真实数据的条件信息进行生成。本文考察在此类模型中强制执行 DP 的 utility 代价,围绕三个问题展开研究,涉及两个数据集和十一项 utility 指标。(1) 我们评估了 DP-SGD——深度学习中标准的 DP 训练方法——对最新生成模型 utility 的影响。(2) 由于 DP-SGD 仅适用于无条件模型,我们提出了一种 novel DP 机制用于条件生成,提供形式化保证并评估其对 utility 的影响。(3) 我们分析模型类型——扩散模型 (Diffusion)、变分自编码器 (VAE) 和生成对抗网络 (GAN)——对 utility-privacy 折衷的影响。我们的结果表明,DP-SGD 对性能影响显著,尽管在数据集足够大时仍保留部分 utility。该提议的 DP 方法在训练稳定性方面取得改进,特别是与 DP-SGD 结合时,对不稳定的模型(如 GAN)以及小型数据集效果显著。扩散模型在无保证情况下获得最佳 utility,但在 DP-SGD 条件下,GAN 表现最佳,这表明针对形式化保证的最佳非私有模型未必是最优解。总之,DP 轨迹生成仍是一个具有挑战性的任务,目前仅在大型数据集和受限使用场景下才可实现形式化保证。
引用
@article{arxiv.2506.09312,
title = {What is the Cost of Differential Privacy for Deep Learning-Based Trajectory Generation?},
author = {Erik Buchholz and Natasha Fernandes and David D. Nguyen and Alsharif Abuadbba and Surya Nepal and Salil S. Kanhere},
journal= {arXiv preprint arXiv:2506.09312},
year = {2025}
}