基于类别条件与特征相关增强的表格数据对比学习
机器学习
2024-05-01 v2 人工智能
机器学习
摘要
对比学习是一种模型预训练技术,它首先为原始数据创建相似视图,然后促使数据及其对应视图在嵌入空间中相互接近。得益于直观且有效的特定领域增强技术,对比学习在图像和自然语言数据中取得了成功。然而,在表格数据领域,创建视图的主要增强技术是通过交换值来破坏表格条目,这并不十分合理或有效。我们提出对该增强技术的一个简单而强大的改进:以类别身份为条件破坏表格数据。具体而言,当从锚点行破坏特定表格条目时,我们不再从整个表中同一特征列中均匀地随机采样值,而是仅从被识别为与锚点行属于同一类别的行中进行采样。我们假设处于半监督学习设置下,并采用伪标签技术来获取所有表行的类别身份。我们还探索了基于特征相关结构选择要破坏的特征这一新颖想法。大量实验表明,所提出的方法在表格数据分类任务中始终优于传统的破坏方法。我们的代码可在 https://github.com/willtop/Tabular-Class-Conditioned-SSL 获取。
引用
@article{arxiv.2404.17489,
title = {Tabular Data Contrastive Learning via Class-Conditioned and Feature-Correlation Based Augmentation},
author = {Wei Cui and Rasa Hosseinzadeh and Junwei Ma and Tongzi Wu and Yi Sui and Keyvan Golestan},
journal= {arXiv preprint arXiv:2404.17489},
year = {2024}
}
备注
14 pages, 4 algorithms, 3 figures, 5 tables