中文

面向结构化数据的生成模型评估

机器学习 2025-03-28 v1 人工智能

摘要

合成表格数据生成已成为应对数据可用性有限与隐私问题的有前景的方法。近年来,随着大语言模型性能的急剧提升,研究者开始关注将这些模型应用于表格数据的生成。然而,大语言模型所生成表格数据的质量仍知之甚少。评估合成表格数据质量的主流方法是 train-synthetic-test-real 方法,即通过分别在真实集与合成集上训练的机器学习模型在某些下游任务中的表现来比较合成样本与原始样本。该方法并不能直接衡量生成数据分布与原始数据分布之间的近似程度。本文引入严格的方法,通过考察数据中列间依赖关系,直接将合成表格数据与真实数据进行对比评估。我们发现,大语言模型(GPT-2),无论通过少样本提示查询还是经过微调,以及 GAN(CTGAN)模型,均无法生成与原始真实数据具有相同依赖关系的数据。本研究的结果可为未来合成数据生成实践中提升数据质量提供参考。

关键词

引用

@article{arxiv.2503.20903,
  title  = {Assessing Generative Models for Structured Data},
  author = {Reilly Cannon and Nicolette M. Laird and Caesar Vazquez and Andy Lin and Amy Wagler and Tony Chiang},
  journal= {arXiv preprint arXiv:2503.20903},
  year   = {2025}
}