中文

优化支持向量回归用于加州房价预测:特征工程与超参数调优的关键作用

机器学习 2026-05-12 v1

摘要

在近期文献中,支持向量回归 (SVR) 被引用为加州房价基准数据集中最弱的表现者之一,Preethi 等人 (2025) 具体将其在所测试的算法中排名最后,报告的 R2 仅为 0.60。本文检验此前报告的表现是否反映了实验配置选择,而非固有的算法局限。采用结构化的实验工作流程:从八个原始输入中构建十个基于领域的衍生特征,利用探索性集成特征重要性分析识别最具预测力的特征,随后通过三折交叉验证的随机化搜索,对超参数组合进行搜索,以选择优化的 SVR 配置,同时在无数据泄漏的 scikit-learn Pipeline 中完成。进行正式的四阶段消融研究,以隔离每个组件的贡献:仅进行标准化即可提升 R2 值 +0.744(从 -0.054 提升至 0.690),特征工程添加 +0.026(提升至 0.716),超参数调优贡献 +0.008(提升至 0.723)。最终调优后的 SVR 在测试集上获得 R2 为 0.723,较此前报告的 SVR 结果提升了 0.123 点(从 0.60 提升至 0.723,约为 20% 的相对提升)。在十模型比较中,调优后的 SVR 排名第四,R2 为 0.723,低于 XGBoost (0.832)、Random Forest (0.814) 和 Gradient Boosting (0.783),但显著优于更简单的基线模型。十折交叉验证得到平均 R2 为 0.703(95% 置信区间:[0.630, 0.775]),确认了稳健的泛化能力。从 R2 从 0.60 提升至 0.723 的观察结果主要与统一预处理管道中的正确特征标准化有关,同时结合基于领域的特征工程和系统性的超参数调优,提供了额外的增益。

关键词

引用

@article{arxiv.2605.08660,
  title  = {Optimised Support Vector Regression for California Housing Price Prediction: The Critical Role of Feature Engineering and Hyperparameter Tuning},
  author = {Emmanuel Adutwum},
  journal= {arXiv preprint arXiv:2605.08660},
  year   = {2026}
}

备注

25 pages, 13 figures, 10 tables