中文

生成异构多维数据的比较研究

机器学习 2025-07-30 v3 人工智能

摘要

在消防员介入情况下,人员和物料资源的分配极为关键。该分配依赖于仿真来实验各种情境。该分配的主要目标是对消防员响应进行全局优化。因此,数据生成就成为必不可少的,以研究各种情境。本研究提出比较不同的数据生成方法。包括随机抽样、表格变分自编码器、标准生成对抗网络、条件表格生成对抗网络和扩散概率模型等方法,旨在确定其在捕捉消防员介入细节方面的有效性。传统评估指标往往难以捕捉面向真实场景的合成数据集所需的细微要求。为填补这一差距,采用结合专门针对消防员领域的指标和标准措施(如Wasserstein距离)的组合,对合成数据质量进行评估。领域特定指标包括响应时间分布、介入的时空分布以及事故表征。这些指标旨在评估数据变异性、精细复杂相关性和异常(如极低发生率事件)的保留情况,以及与初始统计分布的一致性和合成数据的操作相关性。该分布具有高度不平衡的特征,None的变量均不遵循正态分布,这使得数据生成过程具有复杂性。

关键词

引用

@article{arxiv.2507.00090,
  title  = {Generating Heterogeneous Multi-dimensional Data : A Comparative Study},
  author = {Michael Corbeau and Emmanuelle Claeys and Mathieu Serrurier and Pascale Zaraté},
  journal= {arXiv preprint arXiv:2507.00090},
  year   = {2025}
}

备注

accepted at IEEE SMC 2025 Vienna