中文

面向表格数据的分布鲁棒自监督学习

机器学习 2025-11-10 v6

摘要

使用经验风险最小化 (ERM) 训练的机器学习模型常在表格数据的特定子population中出现系统性错误,称为 error slice。面对 error slice 中的稀疏标注,学习鲁棒表示具有挑战性,尤其是在特征重构阶段由于高基数特征和构造 error 集的复杂性。在计算机视觉中,传统的鲁棒表示学习方法主要致力于提高监督设置下最差 group 性能,导致针对表格数据的方法在 this gap。我们通过开发一个框架来学习表格数据在自监督预训练期间的鲁棒表示。我们的做法利用 encoder-decoder 模型训练 Masked Language Modeling (MLM) loss 来学习鲁棒的潜在表示。本文在表格数据的预训练阶段应用 Just Train Twice (JTT) 和 Deep Feature Reweighting (DFR) 方法。这些方法通过对 error 易发生样本进行加权或为特定类别特征创建平衡数据集来微调 ERM 预训练模型。这导致为每个特征生成专门的模型,然后通过集成方法来提高下游分类性能。该方法提高了跨 slice 的鲁棒性,从而增强了整体泛化性能。广泛的实验在 various 数据集上表明了我们方法的有效性。代码可在 https://github.com/amazon-science/distributionally-robust-self-supervised-learning-for-tabular-data 提供。

关键词

引用

@article{arxiv.2410.08511,
  title  = {Distributionally robust self-supervised learning for tabular data},
  author = {Shantanu Ghosh and Tiankang Xie and Mikhail Kuznetsov},
  journal= {arXiv preprint arXiv:2410.08511},
  year   = {2025}
}

备注

TRL Workshop@NeurIPS2024