CTTVAE:面向不平衡数据集的条件表格数据生成中的潜在空间结构化
机器学习
2026-02-04 v1
摘要
在严重类别不平衡的情况下生成合成表格数据对于驱动决策且占重要比重的罕见但高影响事件的领域至关重要。然而,大多数生成模型要么忽视少数族群,要么无法产生对下游学习有用的样本。我们引入 CTTVAE,一个基于条件转换器的表格变分自编码器,配备两种互补机制:(i) 一种 class-aware triplet margin loss,用于在潜在空间中实现更锐利的类内紧凑性和类间分离;(ii) 一种 training-by-sampling 策略,用于适应性地增加对 underrepresented 群体的暴露。这些组件共同构成 CTTVAE+TBS 框架, consistently yields more representative and utility-aligned 的样本,而不会 destabilize training。在六个真实世界基准中,CTTVAE+TBS 在少数族群上实现最强的下游效用,常常超过在原始不平衡数据上训练的模型,同时保持具竞争力的保真度并弥合了插值抽样方法和深度生成方法之间的隐私差距。消融研究进一步确认,latent 结构化和 targeted sampling 都对这些收益有贡献。通过显式优先考虑稀有类别中的下游性能,CTTVAE+TBS 提供了一个稳健且可解释的解决方案,用于条件表格数据生成,直接适用于 healthcare、欺诈检测和预测性维护等行业,即使在稀有案例中获得微小的提升也可能至关重要。
引用
@article{arxiv.2602.03641,
title = {CTTVAE: Latent Space Structuring for Conditional Tabular Data Generation on Imbalanced Datasets},
author = {Milosh Devic and Jordan Gierschendorf and David Garson},
journal= {arXiv preprint arXiv:2602.03641},
year = {2026}
}