基于深度强化学习的足球比赛关键情境最优动作研究
机器学习
2021-09-15 v1
摘要
足球是一种稀疏奖励的游戏:在关键情境下任何明智或疏忽的动作都可能改变比赛结果。因此,球员、教练和球探都对在关键情境(例如丢球或进球概率较高的时刻)中执行的最佳动作充满好奇。本文提出了一种用于足球比赛的新状态表示,以及一种批量强化学习方法来训练智能策略网络。该网络获取情境的上下文信息,并提出最优动作以最大化球队的期望进球数。我们在 InStat 提供的 104 场欧洲足球比赛日志上进行了大量数值实验。结果表明,在所有 104 场比赛中,优化策略获得的奖励均高于行为策略中的对应策略。此外,我们的框架学习到的策略接近于现实世界中的期望行为。例如,在优化策略中,我们观察到在某些特定情境下,犯规或球出界等动作有时比射门更具奖励性。
引用
@article{arxiv.2109.06625,
title = {Towards optimized actions in critical situations of soccer games with deep reinforcement learning},
author = {Pegah Rahimian and Afshin Oroojlooy and Laszlo Toka},
journal= {arXiv preprint arXiv:2109.06625},
year = {2021}
}