中文

T-JEPA:面向表格数据的无数据增强自监督学习

机器学习 2025-05-06 v3 机器学习

摘要

自监督学习常用于预训练,以构建样本的有意义表征来提升下游任务性能。自监督学习(SSL)通常涉及生成同一样本的不同视图,从而需要针对表格数据具有挑战性的数据增强。这构成了结构化数据自监督学习的主要挑战之一。本文提出一种面向表格数据的新型无数据增强SSL方法。我们的方法T-JEPA基于联合嵌入预测架构(JEPA),类似于在潜空间中的掩码重建。它通过预测一个子特征集合的潜表示来预测另一个子特征集合在同一样本内的潜表示,从而在无需数据增强的情况下学习丰富的表征。我们将该方法作为预训练技术使用,并在获得的表征上训练多个深度分类器。我们的实验结果表明,在分类和回归任务上均实现了显著提升,优于在原始数据空间中直接训练的模型。此外,T-JEPA使一些方法能够持续超越或匹配传统方法(如梯度提升决策树)的性能。为此,我们对获得的表征进行了广泛表征,展示了T-JEPA在不获取标签的情况下有效识别下游任务的相关特征。我们还引入了正则化标记,作为结构化数据上JEPA模型训练的新型正则化方法。

关键词

引用

@article{arxiv.2410.05016,
  title  = {T-JEPA: Augmentation-Free Self-Supervised Learning for Tabular Data},
  author = {Hugo Thimonier and José Lucas De Melo Costa and Fabrice Popineau and Arpad Rimmel and Bich-Liên Doan},
  journal= {arXiv preprint arXiv:2410.05016},
  year   = {2025}
}

备注

Accepted at ICLR 2025: https://openreview.net/forum?id=gx3LMRB15C