中文

基准评估合成表格数据:多维度评估框架

机器学习 2025-04-03 v1 人工智能

摘要

评估合成数据质量是确保数据驱动研究中隐私与实用性的关键挑战。本文提出了一个评估框架,量化合成数据在确保隐私的同时,如何良好地复制原始分布属性。该方法采用保留基准策略,通过低维和高维分布比较、嵌入式相似性测度以及最近邻距离度量,实现定量评估。该框架支持多种数据类型和结构,包括序列和上下文信息,并通过一组标准化指标实现可解释的质量诊断。这些贡献旨在支持合成数据生成技术的可重复性和方法论一致性。框架的代码可在 https://github.com/mostly-ai/mostlyai-qa 查看。

关键词

引用

@article{arxiv.2504.01908,
  title  = {Benchmarking Synthetic Tabular Data: A Multi-Dimensional Evaluation Framework},
  author = {Andrey Sidorenko and Michael Platzer and Mario Scriminaci and Paul Tiwald},
  journal= {arXiv preprint arXiv:2504.01908},
  year   = {2025}
}

备注

16 pages, 7 figures, 1 table