用于 modeling and prediction Grand Slam网球赛赛事的统计增强学习
应用统计
2025-02-27 v2
摘要
本文聚焦于称为统计增强变量(statistically enhanced covariates)的特定类型变量,用于建模和预测大满贯锦标赛中男子网球赛的结果。我们的目标是评估这些增强变量是否具有提升统计学习方法,特别是预测性能的潜力。为此,我们比较了各种提出的回归和机器学习模型类,分别在包含和不包含此类特征的情况下进行评估。为实现此目标,我们考虑了三个略微增强的变量,即包括两个不同年龄变量的Elo评级。该概念已在足球中成功应用,额外的团队能力参数(来自独立统计模型)能够提升预测性能。在此基础上,运用不同的可解释机器学习(IML)工具可获得对由复杂机器学习模型(如随机森林)预测的赛果影响因素的洞察。具体而言,采用部分依赖图(PDP)和个体条件期望(ICE)图为本工作中最有前景的ML模型提供更好的可解释性。此外,我们在分类率、预测伯努利似然和Brier分数等各种预测性能度量标准方面,对不同回归和机器学习方法进行比较。该比较采用交叉验证、滚动窗口和扩张窗口策略在外部测试数据上进行。
引用
@article{arxiv.2502.01613,
title = {Statistical enhanced learning for modeling and prediction tennis matches at Grand Slam tournaments},
author = {Nourah Buhamra and Andreas Groll},
journal= {arXiv preprint arXiv:2502.01613},
year = {2025}
}