中文

评估用于增强小样本数据集的合成表格数据

机器学习 2025-03-18 v5 机器学习

摘要

本文提出了一种评估用于增强小样本数据集的合成表格数据的方法。尽管数据增强技术可增加机器学习应用的样本量,但传统验证方法在应用于极有限样本量时会失效。我们在四个数据集上的实验揭示了全局指标与拓扑度量之间的显著不一致,由于样本量不足,统计检验产生了不可靠的显著性值。我们证明,像倾向评分和MMD这样的常用指标常常在存在基本拓扑差异的情况下暗示相似性。我们提出的基于归一化Bottleneck距离的度量提供了补充性见解,但在不同实验运行中表现出高变异性,且偶尔出现超出理论界的值,显示出拓扑方法在极小数据集上的固有不稳定性。这些发现凸显了在验证由有限样本生成的合成数据时,对多面评估方法的迫切需求,因为没有任何单一指标能可靠地同时捕捉分布相似性与结构相似性。

关键词

引用

@article{arxiv.2211.10760,
  title  = {Evaluating Synthetic Tabular Data Generated To Augment Small Sample Datasets},
  author = {Javier Marin},
  journal= {arXiv preprint arXiv:2211.10760},
  year   = {2025}
}