机器学习中特征缩放的影响:对回归与分类任务的作用
机器学习
2025-11-24 v5 机器学习
摘要
本研究通过在 16 个数据集上使用 14 种不同的机器学习算法评估 12 种缩放技术(包括几种较少见的变换),对分类和回归任务中特征缩放缺乏全面研究的问题进行了系统性探讨。我们细致分析了其对预测性能(使用准确率、MAE、MSE 和 等指标)和计算成本(训练时间、推理时间和内存使用)的影响。主要发现表明,虽然集成方法(如 Random Forest 和 XGBoost、CatBoost 及 LightGBM 等梯度提升模型)表现出很大程度上独立于缩放的稳健性能,但其他广泛使用的模型(如 Logistic Regression、SVM、TabNet 和 MLP)则表现出高度依赖于所选缩放器的显著性能差异。这项广泛的经验分析(所有源代码、实验结果和模型参数均已公开提供,以确保完全透明和可复现性)为从业者提供了针对特定模型的关键指导,说明了最优选择特征缩放技术的必要性。
引用
@article{arxiv.2506.08274,
title = {The Impact of Feature Scaling In Machine Learning: Effects on Regression and Classification Tasks},
author = {João Manoel Herrera Pinheiro and Suzana Vilas Boas de Oliveira and Thiago Henrique Segreto Silva and Pedro Antonio Rabelo Saraiva and Enzo Ferreira de Souza and Ricardo V. Godoy and Leonardo André Ambrosio and Marcelo Becker},
journal= {arXiv preprint arXiv:2506.08274},
year = {2025}
}
备注
36 pages