中文

基于大数据与机器学习的ATP大满贯网球赛赛点结果分析

应用统计 2025-06-09 v1

摘要

网球是全球最大且最受欢迎的运动之一。多位研究者曾尝试使用概率建模或机器学习方法对赛果进行建模,但成效有限。本文提出的一种方法旨在预测网球比赛中赛点的结果。该方法基于给定的赢得该赛点的概率,这一概率由赛事历史记录、当前比赛情况、球员排名以及该赛点是否为首盘或次盘决定。利用赛事历史数据和球员排名,使本研究得以实现。此外,我们对模型进行解释,以揭示赢得赛点的重要战略因素。历史数据来源于2016至2020年的两项大满贯赛事——Wimbledon和US Open,共计709场比赛。本文应用了多种机器学习方法,如逻辑回归、随机森林、ADABoost和XGBoost。这些模型与一个基准模型进行了比较,即传统统计方法——平均值。结果评估显示,针对赛点预测的模型略优于平均值。然而,由于所采用的数据为公开数据且数据信息水平有限,本文所提出的方法在预测对手在同一排名位置时谁会获胜方面并不理想。该方法在探讨网球赛点结果中哪些因素是决定胜负的关键时具有意义。更高质量的数据集(如Hawk Eye)虽然存在,但尚未公开。

关键词

引用

@article{arxiv.2506.05866,
  title  = {Analysis of points outcome in ATP Grand Slam Tennis using big data and machine learning},
  author = {Martin Illum and Hans Christian Bechsøfft Mikkelsen and Emil Hovad},
  journal= {arXiv preprint arXiv:2506.05866},
  year   = {2025}
}