中文

马尔可夫板球:利用正反向强化学习对一日国际板球击球表现进行建模、预测与优化

机器学习 2021-03-09 v1 系统与控制 系统与控制

摘要

在本文中,我们将一日国际板球比赛建模为马尔可夫过程,应用正向与反向强化学习(RL)为该运动开发三种新颖工具。首先,我们应用蒙特卡洛学习,基于得分奖励模型拟合比赛每个状态价值函数的非线性近似。我们表明,当用作剩余得分资源的代理时,该方法比职业比赛中使用的最先进Duckworth-Lewis-Stern方法的误差低3至10倍。接下来,我们使用反向强化学习,具体为引导代价学习的一种变体,基于专家表现(此处假定为获胜队伍的击球序列)推断奖励的线性模型。从该模型我们显式确定了每个状态的最优策略,并发现其与关于该比赛的常识直觉一致。最后,我们利用推断的奖励模型构建比赛模拟器,在不同策略下对最终得分的后验分布建模。我们设想我们的预测与模拟技术可为中断比赛的终分估计提供更公平的替代方案,而推断的奖励模型可为职业比赛优化击球策略提供有用见解。此外,我们预期这种将RL应用于该比赛的方法可更广泛地应用于其他具有离散比赛状态且队伍轮流的体育项目,如棒球和圆场球。

关键词

引用

@article{arxiv.2103.04349,
  title  = {Markov Cricket: Using Forward and Inverse Reinforcement Learning to Model, Predict And Optimize Batting Performance in One-Day International Cricket},
  author = {Manohar Vohra and George S. D. Gordon},
  journal= {arXiv preprint arXiv:2103.04349},
  year   = {2021}
}

备注

15 pages, 8 Figures