中文

面向低标签场景的表格数据的混合自编码器:基于模型化数据增强

机器学习 2025-11-11 v1 人工智能

摘要

深度神经网络因对无关特征敏感以及对平滑、低频函数的谱偏好,常在表格数据上表现不佳。这一限制阻碍了其捕捉表格结构尤其在标签有限时的尖锐、高频信号的能力。虽然自监督学习(SSL)在此类场景下展现潜力,但在表格领域由于缺乏有效的数据增强方法,仍面临挑战。我们提出一种混合自编码器,将神经编码器与无注意力软决策树(OSDT)编码器组合,每个编码器都由执行样本特定特征选择的随机门控网络引导。这些结构不同且模型特定的编码器与门控网络共同实现模型化数据增强,为每个架构生成互补的输入视图。两个编码器通过共享解码器和交叉重构损失进行训练,学习出彼此独立且对齐的表征,反映各自的归纳偏差。在训练过程中,OSDT 编码器(对噪声鲁棒且擅长建模局部、高频结构)引导神经编码器向更贴合表格数据表征的方向发展。在推断阶段,仅使用神经编码器,保留其灵活性和 SSL 兼容性。谱分析突显了每个编码器的distinct归纳偏差。我们的方法在多样化表格数据集上实现了低标签分类和回归任务中的持续性提升,超越深度和基于树的监督基线。

关键词

引用

@article{arxiv.2511.06961,
  title  = {Hybrid Autoencoders for Tabular Data: Leveraging Model-Based Augmentation in Low-Label Settings},
  author = {Erel Naor and Ofir Lindenbaum},
  journal= {arXiv preprint arXiv:2511.06961},
  year   = {2025}
}

备注

accepted to neurips 2025, main text is 10 pages