登上ISS:不平衡自监督——混合表格数据集的缩放自编码器发现
机器学习
2024-03-26 v1 机器学习
摘要
不平衡自监督学习领域,尤其是在表格数据背景下,尚未得到广泛研究。现有研究主要集中在图像数据集上。本文旨在通过研究自监督学习中表格数据领域数据不平衡带来的具体挑战来填补这一空白,主要关注自编码器。自编码器广泛用于学习和构建数据集的新表示,特别是用于降维。它们也常用于生成模型学习,如变分自编码器。处理混合表格数据时,定性变量通常使用独热编码和标准损失函数(MSE或交叉熵)。本文分析了这种方法的缺点,特别是当分类变量不平衡时。我们提出了一种新的度量来平衡学习:多监督平衡MSE。该方法通过平衡变量的影响来减少重构误差。最后,我们通过实验证明,与标准MSE相比,这种新度量:i) 在数据集不平衡时表现更好,尤其是当学习过程不足时;ii) 在相反情况下提供相似的结果。
引用
@article{arxiv.2403.15790,
title = {Boarding for ISS: Imbalanced Self-Supervised: Discovery of a Scaled Autoencoder for Mixed Tabular Datasets},
author = {Samuel Stocksieker and Denys Pommeret and Arthur Charpentier},
journal= {arXiv preprint arXiv:2403.15790},
year = {2024}
}