中文

超大规模金融表格数据的 KAN 与 gMLP 混合模型

机器学习 2025-03-17 v3

摘要

表格数据在现实金融场景中发挥着关键作用。传统方法下,树模型在处理表格数据方面占据主导地位。然而,金融数据集常面临数据异构性、数值特征占主导以及数据规模巨大的挑战(可达数千万至数亿条记录),这些挑战会导致基于树的模型在内存和计算资源方面出现严重问题。因此,亟需一种能超越这些模型的神经网络解决方案。本文引入 TKGMLP,一种用于表格数据的混合网络,结合了浅层 Kolmogorov Arnold 网络 (KAN) 与 Gated Multilayer Perceptron。该模型利用两种架构的优势,提升性能和可扩展性。我们在真实的信用评分数据集上验证了 TKGMLP,实现了超越现有基准的状态突破性能。此外,我们的研究表明,该模型随数据集规模的增大而持续提升,具有高度可扩展性。我们还提出了一种新颖的数值特征编码方法,专为解决金融数据集中数值特征占主导的挑战而设计。将该特征编码方法集成到 TKGMLP 中,可显著提升预测准确性。这一研究不仅推动了表格预测技术的发展,也为处理各类工业应用中的大规模数值表格数据提供了实用且有效的解决方案。

关键词

引用

@article{arxiv.2412.02097,
  title  = {Beyond Tree Models: A Hybrid Model of KAN and gMLP for Large-Scale Financial Tabular Data},
  author = {Mingming Zhang and Jiahao Hu and Pengfei Shi and Ningtao Wang and Ruizhe Gao and Guandong Sun and Feng Zhao and Yulin kang and Xing Fu and Weiqiang Wang and Junbo Zhao},
  journal= {arXiv preprint arXiv:2412.02097},
  year   = {2025}
}

备注

the paper has mistakes in section3.1