面向表格基础模型的端到端压缩
机器学习
2026-02-06 v1
摘要
梯度提升决策树长期主导表格数据处理,近期则被基于原语学习的表格基础模型所挑战。原语学习方法无需参数更新即可完成拟合与预测,通过将训练数据作为上下文来预测查询测试点。在最近的表格基础模型取得最先进性能的同时,其基于注意力机制的Transformer架构在数据集规模上的二次复杂度增加,进而导致训练和推理开销增加,限制了模型处理大规模数据集的能力。为此,我们提出了TACO——一种端到端表格压缩模型,通过压缩训练数据集在潜空间中的表示来实现。我们在TabArena基准测试上测试了该方法,其中我们提出的方法在推理时间上快至94倍,内存消耗降低至97%,同时保持性能而未出现显著退化。最后,我们的方法不仅在数据集规模增大时更具扩展性,而且在其他基线方法中也实现了更好的性能。
引用
@article{arxiv.2602.05649,
title = {End-to-End Compression for Tabular Foundation Models},
author = {Guri Zabërgja and Rafiq Kamel and Arlind Kadra and Christian M. M. Frey and Josif Grabocka},
journal= {arXiv preprint arXiv:2602.05649},
year = {2026}
}