面向表格型合成数据生成的框架:极简方法:理论、用例与局限性
机器学习
2024-11-21 v2 统计方法学
机器学习
摘要
我们提出并研究了一种用于合成表格型数据生成的极简方法。该模型由极简的无监督 SparsePCA 编码器(带有条件聚类步骤或对数变换以处理非线性)和 XGBoost 解码器组成,后者在结构化数据的回归和分类任务中是 SOTA。我们在几个低维玩具场景中研究并对比了该方法与(变分)自编码器的方法论,以推导必要的直觉。该框架被应用于高维模拟信用评分数据,这与现实生活中的金融应用相平行。我们将该方法应用于鲁棒性测试,以展示其实际用例。案例研究结果表明,该方法为模型鲁棒性测试中的原始扰动和分位数扰动提供了替代方案。我们表明该方法简单,全程保证可解释性,无需额外调参,并提供独特优势。
引用
@article{arxiv.2411.10982,
title = {Towards a framework on tabular synthetic data generation: a minimalist approach: theory, use cases, and limitations},
author = {Yueyang Shen and Agus Sudjianto and Arun Prakash R and Anwesha Bhattacharyya and Maorong Rao and Yaqun Wang and Joel Vaughan and Nengfeng Zhou},
journal= {arXiv preprint arXiv:2411.10982},
year = {2024}
}