中文

基于样条函数的 Kolmogorov-Arnold 网络特征重要性:面向监督性表格数据降维的框架

机器学习 2026-03-20 v3

摘要

特征选择是许多表格预测问题中的关键步骤,其中可能存在冗余、噪声或信息弱的多个候选变量。我们研究基于 Kolmogorov-Arnold 网络(KANs)的特征选择方法,这些网络使用样条函数参数化特征变换,并自然暴露出每个特征的重要性分数。从这一思想中我们导出四种 KAN 基于的选择准则(系数范数、梯度基 saliency 以及 knockout 分数),并将其与标准方法(如 LASSO、Random Forest 特征重要性、互信息、SVM-RFE)在一套真实和合成的分类与回归数据集上进行比较。在三个特征保留水平(20%、40%、60%)下的平均 F1 和 R2R^2 分数方面,我们发现 KAN 基于的选择器通常与经典基线方法并驾齐驱,有时甚至更优。在分类任务中,KAN 准则常常在多类任务中匹配或超越现有方法,通过消除冗余特征并捕获非线性相互作用。在回归任务中,KAN 基于的分数在噪声和异构数据集上表现稳健, closely tracks strong ensemble predictors;我们也观察到特征,如过于激进的 1\ell_1 准则剪枝。稳定性和冗余性分析进一步表明,KAN 基于的选择器在不同折叠之间 yield 可重复的特征子集,同时避免不必要的相关性膨胀,确保可靠且非冗余的变量选择。总体而言,我们的发现表明 KAN 基于的特征选择提供了一种强大且可解释的传统方法的替代方案,能够揭示超越稀疏性或不纯度基准的非线性和多变量特征相关性。

关键词

引用

@article{arxiv.2509.23366,
  title  = {Splines-Based Feature Importance in Kolmogorov-Arnold Networks: A Framework for Supervised Tabular Data Dimensionality Reduction},
  author = {Ange-Clément Akazan and Verlon Roel Mbingui},
  journal= {arXiv preprint arXiv:2509.23366},
  year   = {2026}
}