SOS:面向表格数据的基于分数的过采样
机器学习
2022-06-20 v1 人工智能
摘要
基于分数的生成模型(SGMs)是生成伪造图像领域的近期突破。已知 SGMs 优于其他生成模型,例如生成对抗网络(GANs)与变分自编码器(VAEs)。受其巨大成功的启发,本文中我们对其进行了充分定制以生成伪造表格数据。具体而言,我们关注少数类的过采样,因为类别不平衡常导致次优训练结果。据我们所知,我们首次提出了一种基于分数的表格数据过采样方法。首先,我们重新设计了自身的分数网络以处理表格数据。其次,我们提出了两种生成方法选项:前者等价于表格数据的风格迁移,后者使用 SGMs 的标准生成策略。最后,我们定义了一种微调方法,进一步提升过采样质量。在 6 个数据集与 10 个基线的实验中,我们的方法在所有情形下均优于其他过采样方法。
引用
@article{arxiv.2206.08555,
title = {SOS: Score-based Oversampling for Tabular Data},
author = {Jayoung Kim and Chaejeong Lee and Yehjin Shin and Sewon Park and Minjung Kim and Noseong Park and Jihoon Cho},
journal= {arXiv preprint arXiv:2206.08555},
year = {2022}
}
备注
Accepted by KDD 2022