从均匀到学习的结点:基于样条的数值编码在表格深度学习中的研究
机器学习
2026-04-08 v1
摘要
数值预处理是表格深度学习中的重要组成部分,其中连续特征的表示方式会严重影响下游性能。虽然在经典统计和机器学习模型中,其重要性已广为人知,但在表格深度学习中,显式的数值预处理在何种作用仍不太为人所理解。本文聚焦于基于样条的数值编码,研究这一问题。我们考察了三类样条族用于特征编码,包括 B 样条、M 样条和积分样条(I 样条),并在均匀、分位数、目标感知和可学习结点放置下进行编码。对于可学习结点变体,我们采用可微分结点参数化,使结点位置能够与主干网络联合进行端到端优化。我们使用 MLP、ResNet 和 FT-Transformer 主干网络,对这些编码在多样化的公开回归和分类数据集上进行评估,并将其与常见的数值预处理基线进行比较。我们的结果表明,数值编码的效果严重取决于任务、输出大小和主干网络。对于分类,分段线性编码(PLE)是总体上最稳健的选择,而基于样条的编码保持竞争力。对于回归,没有单一的编码在所有情况下都占据优势。相反,性能取决于样条族、结点放置策略和输出大小,对于 MLP 和 ResNet 通常观察到更大的提升,而对于 FT-Transformer 则有限。我们进一步发现,在所提出的参数化下,可学习结点变体可以稳定地进行优化,但尤其是对于 M 样条和 I 样条扩展,可能会显著增加训练成本。总体而言,结果表明,数值编码不仅应以预测性能为标准进行评估,还应考虑计算开销。
引用
@article{arxiv.2604.05635,
title = {From Uniform to Learned Knots: A Study of Spline-Based Numerical Encodings for Tabular Deep Learning},
author = {Manish Kumar and Anton Frederik Thielmann and Christoph Weisser and Benjamin Säfken},
journal= {arXiv preprint arXiv:2604.05635},
year = {2026}
}
备注
20, 9 figures