中文

基于集成树的葡萄酒质量预测:统一、无泄漏的比较研究

机器学习 2025-06-10 v1

摘要

准确且可复现的葡萄酒质量评估对于生产控制至关重要,但目前仍由主观、劳动密集型的品鉴小组主导。我们首次在经典的Vinho Verde红葡萄酒和白葡萄酒数据集(分别有1,599和4,898个实例,11个理化属性)上,对五种集成学习器(随机森林、梯度提升、XGBoost、LightGBM、CatBoost)进行了统一基准测试。我们的无泄漏工作流程采用80:20分层训练-测试分割、训练集内的五折StratifiedGroupKFold、每折标准化、SMOTE-Tomek重采样、逆频率成本加权、Optuna超参数搜索(每个模型120-200次试验)以及两阶段特征选择重拟合。最终分数在未触碰的测试集上报告,以加权F1作为主要指标。梯度提升实现了最高准确率(红葡萄酒加权F1为0.693 ± 0.028,白葡萄酒为0.664 ± 0.016),随机森林和XGBoost紧随其后,差距在三个百分点以内。将每个模型限制在其排名前五的变量上,可将维度降低55%,而红葡萄酒和白葡萄酒的加权F1仅分别降低2.6和3.0个百分点,表明酒精、挥发性酸度、硫酸盐、游离SO2和氯化物捕获了大部分预测信号。在EPYC 9K84/H20节点上的运行时分析揭示了陡峭的效率梯度:梯度提升平均每次五折研究需要12小时,XGBoost和LightGBM需要2-3小时,CatBoost需要1小时,随机森林不到50分钟。因此,我们推荐随机森林作为最具成本效益的生产模型,XGBoost和LightGBM作为GPU高效的替代方案,梯度提升作为离线基准测试的准确率上限。完全文档化的流程和指标集为未来在不平衡多类葡萄酒质量预测方面的工作提供了可复现的基线。

关键词

引用

@article{arxiv.2506.06327,
  title  = {Wine Quality Prediction with Ensemble Trees: A Unified, Leak-Free Comparative Study},
  author = {Zilang Chen},
  journal= {arXiv preprint arXiv:2506.06327},
  year   = {2025}
}

备注

14pages, 7figures,2tables