中文

图能否改进表格基础模型?

机器学习 2025-12-16 v1

摘要

表格数据是许多现实世界系统的核心。尽管近期的表格 Transformer 和上下文学习器(如 SAINT、TP-BERTa、TabPFN、TabICL 和 MITRA)引入了有限的行间推理,但大多数方法仍缺乏对实例间关系进行建模的显式机制,即使相似样本通常具有相关结果。我们研究了引入\emph{简单图先验}能否增强\emph{预训练表格 Transformer}。具体而言,我们引入了 BOLERO,一种轻量级的静态二部图头部,用于增强 RoBERTa-Tab(一种通过掩码 token 预测预训练的 RoBERTa 风格表格主干网络)。每个实例连接到特征/值锚点;一个小型 GNN 在主干网络保持冻结的情况下细化行表示。我们在 TP-BERTa 基准套件的 80 个分类和 64 个回归数据集上进行评估,与包括 XGBoost、CatBoost、TabPFN-v2、MITRA、TabICL、TP-BERTa 和 RoBERTa-Tab 在内的强基线进行比较。为确保统计上可靠的结论,我们遵循多数据集评估的最佳实践:对每个数据集的得分差异进行成对 Wilcoxon 符号秩检验并计算效应量(带有置信区间的中位改进),而非依赖于竞争者池的平均秩事后检验。BOLERO 在分类和回归任务中均取得了最多的统计显著胜出,表明轻量级图先验能显著改进预训练表格 Transformer。

关键词

引用

@article{arxiv.2512.12405,
  title  = {Can Graphs Improve Tabular Foundation Models?},
  author = {Franck Le and Keith Grueneberg and Erich Nahum and Vadim Sheinin},
  journal= {arXiv preprint arXiv:2512.12405},
  year   = {2025}
}