中文

多类分类中的特征选择与正则化:基于梯度下降优化和 L1 稀疏约束的 One-vs-Rest 逻辑回归实证研究

机器学习 2025-10-24 v2 人工智能

摘要

多类酒酿分类呈现了模型准确率、特征维度和可解释性之间的根本性权衡——这些因素对于分析化学中的生产部署至关重要。本文对在UCI酒数据集(178个样本,3种酿造剂,13个化学特征)上进行的One-vs-Rest逻辑回归进行全面实证研究,比较了从零实现的梯度下降实现与scikit-learn的优化求解器,并量化了L1正则化对特征稀疏性的影响。手动实现的梯度下降以92.59%的平均测试准确率实现平滑收敛,验证了理论基础,尽管scikit-learn提供了24倍的训练加速和98.15%的准确率。类别特定分析揭示了不同化学特征的独特化学信号,呈现出异构模式,其中酒精度在不同酿造剂之间差异巨大(0.31至16.50)。L1正则化实现了54%-69%的特征降维,仅导致4.63%的准确率下降,显示出有利的可解释性-性能权衡。我们提出了一个实现62%复杂度降低、估计92%-94%准确率的5特征子集,使每样本成本节省80美元、时间缩减56%。统计验证确认了稳健的泛化能力,预测延迟低于2毫秒,适合实时质量控制。我们的发现为实践者提供了可操作的指南,帮助他们在资源受限的环境中平衡全面化学分析与针对性特征测量。

关键词

引用

@article{arxiv.2510.14449,
  title  = {Feature Selection and Regularization in Multi-Class Classification: An Empirical Study of One-vs-Rest Logistic Regression with Gradient Descent Optimization and L1 Sparsity Constraints},
  author = {Jahidul Arafat and Fariha Tasmin and Sanjaya Poudel},
  journal= {arXiv preprint arXiv:2510.14449},
  year   = {2025}
}

备注

29 pages, 7 figures, 5 tables. Submitted to Machine Learning track. Comprehensive empirical evaluation of interpretable linear classification for analytical chemistry applications with focus on production deployment constraints, cost-benefit analysis, and class-specific feature importance patterns