面向高监督学习效用训练数据生成:数据修剪与列重排
机器学习
2025-07-15 v1 机器学习
摘要
监督学习('SL')模型训练的表格数据合成正在吸引医疗、金融和零售等行业的关注。尽管在表格数据生成器方面取得了进展,但使用合成数据训练的模型常常表现不如使用原始数据的模型。在合成数据的 SL 效用较低这一问题,源于类别不平衡的放大以及表格生成器忽视的 SL 数据关系。为解决这些挑战,我们借鉴了新兴数据中心人工智能中的技术,阐明了一种新型管道——数据修剪与列重排('PRRO'),将数据中心技术整合到表格数据合成中。PRRO 采用数据修剪引导表格生成器聚焦于信噪比较高的观测,确保合成数据的类别分布与原始数据相吻合。此外,PRRO 采用列重排算法,将生成器的数据建模结构与 SL 模型的结构保持一致。这两个模块使 PRRO 能够优化合成数据的 SL 效用。在 22 个公开数据集上的经验实验表明,使用 PRRO 生成的合成数据在预测性能方面优于不使用 PRRO 的合成数据。具体而言,使用 PRRO 生成的合成数据替换原始数据可实现平均提升 26.74%,最高可达 871.46%;而将 PRRO 生成的合成数据追加到原始数据中,平均提升 6.13%,最高可达 200.32%。此外,在六个高度不平衡数据集上的实验显示,PRRO 使生成器能够产生更贴近原始数据类别分布的合成数据,相似性提升 43%。通过 PRRO,我们促进了数据合成与后续 SL 预测之间的无缝集成,推动质量和可及的数据分析。
引用
@article{arxiv.2507.10088,
title = {Towards High Supervised Learning Utility Training Data Generation: Data Pruning and Column Reordering},
author = {Tung Sum Thomas Kwok and Zeyong Zhang and Chi-Hua Wang and Guang Cheng},
journal= {arXiv preprint arXiv:2507.10088},
year = {2025}
}
备注
Accepted by Agentic & GenAI Evaluation KDD2025