基于变分自编码器的数据增强方法用于不平衡数据集
机器学习
2024-12-11 v1
摘要
从不平衡分布中学习是预测建模中的一个重大挑战,因为它通常会导致标准算法性能的下降。已存在多种方法来解决此问题,但其中许多关注分类问题,对回归的关注有限。本文提出了一种新方法,旨在增强不平衡回归(IR)框架下表格数据的学习。我们提出使用变分自编码器(VAE),其作为合成数据生成的强大工具,为建模和捕获复杂分布的潜在表示提供了有趣的方法。然而,VAE在处理IR时可能效率低下。因此,我们开发了一种结合VAE与平滑自助法的新方法,专门设计用于应对IR的挑战。我们通过在模拟和已知IR数据集上与竞争方法进行比较,在数值上验证了该方法的范围。
引用
@article{arxiv.2412.07039,
title = {Data Augmentation with Variational Autoencoder for Imbalanced Dataset},
author = {Samuel Stocksieker and Denys Pommeret and Arthur Charpentier},
journal= {arXiv preprint arXiv:2412.07039},
year = {2024}
}