重新审视效用:揭示合成 mobility 数据生成算法在真实场景中的局限性
密码学与安全
2024-07-04 v1
摘要
近年来,开发用于生成合成 mobility 数据的模型数量急剧增加。这些模型旨在 facilitate 数据共享,同时保护隐私,并确保在潜在应用方面的高效用性和灵活性。然而,当前的效用评估方法未能完全考虑真实需求。我们评估了五种最先进的合成方法的效用,这些方法在不同情况下都包含或不包含差分隐私 (DP) 保证,具体体现在现实可应用性方面。特别地,我们关注编码细粒度城市运动(如 GPS 轨迹出租车)的所谓 trip 数据。此类数据对于在路网层面的下游任务尤其有价值。因此,我们的初始步骤是对合成数据进行适当的地图匹配,然后将生成的 trip 与 OpenStreetMap 实现的路由算法生成的 trip 进行比较,该算法作为一种高效且具有隐私保护性的基线。在五个评估的模型中,有一个无法在合理计算时间内生成数据,另一个生成的跳数过多,无法满足地图匹配要求。剩余的三个模型在保持空间分布方面成功程度有限,其中一个即使包含 DP 保证也能做到。这三个模型都在生成具有合理 trip 长度的地理位置序列方面以及在交叉口准确建模交通流方面方程意义。值得注意的是,trip 数据包含了除空间分布之外的各种相关特征,例如时间信息,而这些特征被这些模型所丢弃。因此,我们的结果表明,当前的合成模型在其声称的高效用性和灵活性方面不胜任力。
引用
@article{arxiv.2407.03237,
title = {Reconsidering utility: unveiling the limitations of synthetic mobility data generation algorithms in real-life scenarios},
author = {Alexandra Kapp and Helena Mihaljević},
journal= {arXiv preprint arXiv:2407.03237},
year = {2024}
}
备注
12 pages, 8 figures, 31st ACM International Conference on Advances in Geographic Information Systems (SIGSPATIAL 2023)