KMLP:面向 web 规模表格数据建模的可扩展混合架构
机器学习
2026-02-27 v1
摘要
对 web 规模表格数据的预测建模面临巨大挑战,数据包含数十亿样本和数百种异构数值特征。这些特征呈现各向异性、重尾分布和非平稳特性,成为梯度提升决策树等模型的瓶颈,需大量手动特征工程。我们提出 KMLP,一种集成浅层 Kolmogorov-Arnold 网络 (KAN) 前端与门控多层感知机 (gMLP) 主干的混合深度架构。KAN 前端采用可学习的激活函数,自动为每个特征建模复杂的非线性变换;gMLP 主干捕获高阶相互作用。在公共基准数据集和一个包含数十亿样本的工业数据集上的实验表明,KMLP 实现了最先进的性能,随着规模扩大,与 GBDT 等基线方法的优势不断提升,验证了 KMLP 作为大规模 web 表格数据可扩展深度学习范式的可行性。
引用
@article{arxiv.2602.22777,
title = {KMLP: A Scalable Hybrid Architecture for Web-Scale Tabular Data Modeling},
author = {Mingming Zhang and Pengfei Shi and Zhiqing Xiao and Feng Zhao and Guandong Sun and Yulin Kang and Ruizhe Gao and Ningtao Wang and Xing Fu and Weiqiang Wang and Junbo Zhao},
journal= {arXiv preprint arXiv:2602.22777},
year = {2026}
}
备注
Accepted by THE ACM WEB CONFERENCE 2026