PuckTrick:制造更真实合成数据的库
机器学习
2026-04-30 v1 人工智能
数据库
摘要
机器学习(Machine Learning, ML)模型日益用于决策,此类决策的准确性高度依赖高质量训练数据的保障。然而,由于隐私顾虑、专有限制以及数据不完整等因素,获取真实世界数据集常常受到限制。因此,合成数据生成(Synthetic Data Generation, SDG)已成为可行的替代方案,使能够创建保留真实数据统计特性且符合隐私合规要求的人工数据集。尽管具有上述优势,但合成数据往往过于干净,缺乏真实世界中常见的各种瑕疵,如缺失值、噪声、异常值以及误分类标签等,这些瑕疵会显著影响模型的泛化能力和鲁棒性。为此,我们引入 Pucktrick,这是一个 Python 库,旨在通过引入受控错误来系统性地污染合成数据集。该库支持多种错误类型,包括缺失数据、噪声值、异常值、标签误分类、数据重复以及类别不平衡,提供一种结构化的方法来评估 ML 模型在面对真实世界数据瑕疵时的鲁棒性。Pucktrick 提供两种污染模式:一种用于将错误注入到干净数据集中,另一种用于进一步腐蚀已经被污染的数据集。通过对真实世界金融数据集进行大量实验,我们评估了系统性数据污染对模型性能的影响。我们的发现表明,训练于被污染合成数据的 ML 模型在性能上优于训练于纯粹干净、无错误的合成数据的模型,尤其是针对基于树的方法和线性模型,如支持向量机(SVM)和 Extra Trees。
引用
@article{arxiv.2506.18499,
title = {PuckTrick: A Library for Making Synthetic Data More Realistic},
author = {Alessandra Agostini and Andrea Maurino and Blerina Spahiu},
journal= {arXiv preprint arXiv:2506.18499},
year = {2026}
}
备注
17 pages, 3 figures