中文

TabM:通过参数高效集成推进表格深度学习

机器学习 2025-02-19 v3

摘要

表格数据的监督深度学习架构范围从简单的多层感知机 (MLP) 到复杂的 Transformer 和检索增强方法。本研究突显了一种被严重忽视的机会,用于设计显著更好的基于 MLP 的表格架构。即,我们的新模型 TabM 依赖于高效集成,其中一个 TabM 有效模仿多个 MLP 的集成,并为每个对象产生多个预测。与传统深度集成相比,在 TabM 中,底层隐式 MLP 同时训练,且(默认情况下)共享大部分参数,这导致性能和效率显著提升。将 TabM 作为新的基线,我们在公共基准中对表格深度学习架构进行大规模评估,考虑任务性能和效率,这重新描绘了表格深度学习的格局。一般而言,我们表明 MLP,包括 TabM,形成一条比注意力和检索基架构更强大且更实用的模型序列。特别是,我们发现 TabM 在表格深度学习模型中表现最佳。然后,我们对 TabM 的集成化本质进行经验分析。我们观察到 TabM 的多个预测在单个情况下较弱,但在整体上强大。总体而言,我们的工作为表格深度学习带来一种有影响力的技术,并通过 TabM -- 一个简单且强大的研究者和实践者基线 -- 推进了性能与效率之间的权衡。

关键词

引用

@article{arxiv.2410.24210,
  title  = {TabM: Advancing Tabular Deep Learning with Parameter-Efficient Ensembling},
  author = {Yury Gorishniy and Akim Kotelnikov and Artem Babenko},
  journal= {arXiv preprint arXiv:2410.24210},
  year   = {2025}
}

备注

ICLR 2025. Code: https://github.com/yandex-research/tabm