CARTE:表格学习的预训练与迁移
机器学习
2024-06-03 v2
摘要
预训练深度学习模型是图像或文本的首选解决方案。然而,对于表格数据,标准做法仍然是训练基于树的模型。事实上,表格上的迁移学习面临着数据整合的挑战:寻找对应关系,包括条目中的对应关系(实体匹配,其中不同的词可能指代同一实体)和跨列的对应关系(模式匹配,其顺序、名称等可能不同)。我们提出了一种不需要此类对应关系的神经架构。因此,我们可以利用未匹配的后台数据对其进行预训练。该架构——CARTE(Context Aware Representation of Table Entries,表格条目的上下文感知表示)——利用表格(或关系)数据的图表示来处理具有不同列的表格,使用条目和列名的字符串嵌入来建模开放词汇,并利用图注意力网络结合列名和邻近条目对条目进行上下文化。广泛的基准测试表明,CARTE 促进了学习,超越了一组坚实的基线,包括最佳的基于树的模型。CARTE 还支持在未匹配列的表格之间进行联合学习,用更大的表格增强小表格。CARTE 为表格数据的大型预训练模型打开了大门。
引用
@article{arxiv.2402.16785,
title = {CARTE: Pretraining and Transfer for Tabular Learning},
author = {Myung Jun Kim and Léo Grinsztajn and Gaël Varoquaux},
journal= {arXiv preprint arXiv:2402.16785},
year = {2024}
}