数分钟内倍增您的数据:通过 LLM 诱导的依赖图实现超快表格数据生成
机器学习
2025-07-28 v1 人工智能
摘要
表格数据在各个领域都至关重要,但由于隐私问题和收集成本,高质量数据集仍然稀缺。当代方法采用大型语言模型(LLM)进行表格数据增强,但表现出两个主要局限性:(1) 表格特征之间的密集依赖建模可能会引入偏差;(2) 采样时计算开销高。为了解决这些问题,我们提出了 SPADA(SPArse Dependency-driven Augmentation,稀疏依赖驱动增强),这是一种通过 LLM 诱导的图显式捕获稀疏依赖关系的轻量级生成框架。我们将每个特征视为一个节点,并通过遍历图来合成值,仅根据其父节点对每个特征进行条件化。我们探索了两种合成策略:一种使用高斯核密度估计的非参数方法,以及一种学习可逆映射以进行条件密度估计的条件归一化流模型。在四个数据集上的实验表明,与基于扩散的方法相比,SPADA 将约束违规减少了 4%,并且生成速度比基于 LLM 的基线快近 9,500 倍。
引用
@article{arxiv.2507.19334,
title = {Doubling Your Data in Minutes: Ultra-fast Tabular Data Generation via LLM-Induced Dependency Graphs},
author = {Shuo Yang and Zheyu Zhang and Bardh Prenkaj and Gjergji Kasneci},
journal= {arXiv preprint arXiv:2507.19334},
year = {2025}
}