中文

通过合成数据生成驱动隐私前进:面向智能车辆的信息泄露缓解

密码学与安全 2024-10-14 v1 机器学习

摘要

智能车辆产生大量数据,其中大部分数据敏感且面临隐私泄露风险。随着攻击者日益利用这些数据集中的匿名化元数据来描绘驾驶员画像,找到一种不阻碍创新和持续研究的解决方案以缓解这一信息泄露问题变得至关重要。合成数据已成为解决这些隐私问题的有前景的工具,因为它允许复制真实世界数据关系,同时最大限度地降低泄露敏感信息的风险。本文我们检查了使用合成数据来应对这些挑战的方法。我们首先提出了14种车内传感器的全面分类法,识别潜在攻击并对其脆弱性进行分类。我们 then 聚焦于最脆弱的信号信号,使用被动车辆传感器 (PVS) 数据集生成带有Tabular变分自编码器 (TVAE) 模型的合成数据,数据量超过100万条。最后,我们针对保真度、效用和隐私三个核心指标进行评估。我们的结果显示,我们实现了90.1%的统计相似性和78%的分类准确率,同时也防止了驾驶员的描绘。代码可在 https://github.com/krish-parikh/Synthetic-Data-Generation 查看。

关键词

引用

@article{arxiv.2410.08462,
  title  = {Driving Privacy Forward: Mitigating Information Leakage within Smart Vehicles through Synthetic Data Generation},
  author = {Krish Parikh},
  journal= {arXiv preprint arXiv:2410.08462},
  year   = {2024}
}