中文

CardiCat:用于高基数表格数据的变分自编码器

机器学习 2025-01-30 v1 机器学习

摘要

高基数分类特征是混合类型表格数据集的常见特征。现有的生成模型架构在大规模数据中难以学习此类数据的复杂性,主要是由于难以参数化分类特征。在本文中,我们提出了一种通用的变分自编码器模型CardiCat,能够准确拟合不平衡的高基数和异构表格数据。我们的方法将 one-hot 编码替换为正则化的双编码器-解码器嵌入层,这些层是联合学习的。这一方法使我们能够使用依赖于其他协变量的嵌入,从而实现对分类特征的紧凑且一致的参数化。我们的模型使用远小于竞争方法的可训练参数空间,从而实现大规模学习。CardiCat 生成的高质量合成数据在代表高基数和不平衡特征方面优于多个真实和模拟数据集上的竞争 VAE 模型。

关键词

引用

@article{arxiv.2501.17324,
  title  = {CardiCat: a Variational Autoencoder for High-Cardinality Tabular Data},
  author = {Lee Carlin and Yuval Benjamini},
  journal= {arXiv preprint arXiv:2501.17324},
  year   = {2025}
}