TabR:表格深度学习在2023年邂逅最近邻
机器学习
2023-10-27 v2
摘要
针对表格数据问题(如分类、回归)的深度学习(DL)模型目前正受到研究者越来越多的关注。然而,尽管近期已有诸多努力,基于梯度提升决策树(GBDT)的非深度学习算法仍是解决此类问题的强有力首选方案。旨在改善表格深度学习地位的研究方向之一涉及设计所谓的检索增强模型。对于目标对象,此类模型从可用训练数据中检索其他对象(如最近邻),并利用其特征与标签做出更好的预测。在本工作中,我们提出 TabR——本质上是一个在中间带有自定义类 k 近邻组件的前馈网络。在包含多达数百万对象数据集的一组公开基准上,TabR 标志着表格深度学习的一大步:它在表格深度学习模型中展现出最佳平均性能,在多个数据集上成为新的最先进(state-of-the-art, SOTA)模型,甚至在近期提出的“GBDT 友好”基准上优于 GBDT 模型(见图 1)。支撑 TabR 的重要发现与技术细节中,主要在于负责检索最近邻并从中提取有价值信号的类注意力机制。除性能大幅提升外,与先前的基于检索的表格深度学习模型相比,TabR 更为简单且显著更高效。
引用
@article{arxiv.2307.14338,
title = {TabR: Tabular Deep Learning Meets Nearest Neighbors in 2023},
author = {Yury Gorishniy and Ivan Rubachev and Nikolay Kartashev and Daniil Shlenskii and Akim Kotelnikov and Artem Babenko},
journal= {arXiv preprint arXiv:2307.14338},
year = {2023}
}
备注
Code: https://github.com/yandex-research/tabular-dl-tabr