面向表格交通数据的生成模型系统评估
机器学习
2025-02-14 v1
摘要
大规模交通数据的共享有助于交通规划与政策制定,但也引发显著的安全与隐私问题,因为数据可能包含可识别的个人信息,如居住地点。为此,基于真实交通数据生成合成数据 offers a 有前景的解决方案,可在保护隐私的同时潜在保留数据效用。尽管存在各种合成数据生成技术,但往往不针对交通数据的独特特征进行优化,如由数据集中所有行程形成的交通网络固有结构。本文以纽约市出租车数据为案例,对广泛使用的表格数据生成模型进行系统评估。除传统指标(如分布相似性、覆盖范围和隐私保护)外,我们提出一种专为交通数据设计的新型图基指标。该指标评估真实与合成交通网络之间的相似性,为其结构与功能对齐提供潜在更深入的洞见。我们还引入了改进版隐私指标,以解决常用指标的局限性。实验结果表明,现有表格数据生成模型在实际应用中往往难以如文献所述般持续表现,尤其是针对交通数据场景。进一步,本文的新图指标揭示了合成数据与真实数据之间存在显著差距。本工作凸显了开发针对新兴领域(如交通)独特特征的生成模型以发挥其优势的潜在需求。
引用
@article{arxiv.2502.08856,
title = {A Systematic Evaluation of Generative Models on Tabular Transportation Data},
author = {Chengen Wang and Alvaro Cardenas and Gurcan Comert and Murat Kantarcioglu},
journal= {arXiv preprint arXiv:2502.08856},
year = {2025}
}