PORTAL:通过内容特定分词实现可扩展的表格基础模型
机器学习
2024-10-18 v1
摘要
自监督学习在表格数据上寻求将自然语言和图像领域的进展应用于多样化表格领域。然而,当前技术往往难以整合多域数据,需数据清洗或特定结构要求,限制了预训练数据集的可扩展性。我们引入PORTAL(Pretraining One-Row-at-a-Time for All tabLes),一个在无需清洗或预处理的情况下处理各种数据模态的框架。这种简单而强大的方法可有效预训练于在线收集的数据集,并微调以匹配在复杂分类和回归任务上的最先进方法。本工作为大规模表格数据的自监督学习提供了实用性进展。
引用
@article{arxiv.2410.13516,
title = {PORTAL: Scalable Tabular Foundation Models via Content-Specific Tokenization},
author = {Marco Spinaci and Marek Polewczyk and Johannes Hoffart and Markus C. Kohler and Sam Thelin and Tassilo Klein},
journal= {arXiv preprint arXiv:2410.13516},
year = {2024}
}
备注
Accepted at Table Representation Learning Workshop at NeurIPS 2024