基于经验上下文与布朗运动的羽毛球球员行为离线模仿
人工智能
2024-08-06 v2 机器学习
摘要
在回合制运动动态且快速的战术博弈中,羽毛球作为一种内在范式脱颖而出,要求球员进行依赖于对手的决策。尽管从离线专家数据中进行序列决策学习已在多个领域取得进展,但如何从离线羽毛球比赛中以回合为单位模仿人类球员的行为仍未得到充分探索。复现对手行为有助于球员在赛前进行有方向的策略发展。然而,直接应用现有方法会受制于比赛固有的层次结构以及球员交替行动的回合制特性所带来的复合效应。本文提出 RallyNet,一种用于羽毛球球员行为的新型层次化离线模仿学习模型:(i) RallyNet 通过将决策过程建模为上下文马尔可夫决策过程,捕捉球员的决策依赖关系。(ii) RallyNet 利用经验生成上下文,作为智能体在回合中的意图。(iii) 为生成更逼真的行为,RallyNet 利用几何布朗运动(Geometric Brownian Motion, GBM)对球员间的交互进行建模,为学习球员行为引入了有价值的归纳偏置。通过这种方式,RallyNet 将球员意图与基于 GBM 的交互模型联系起来,为运动分析提供了对交互的理解。我们在包含男子和女子单打的最大可用真实世界羽毛球数据集上广泛验证了 RallyNet,证明了其模仿球员行为的能力。结果表明,RallyNet 优于离线模仿学习方法和最先进的回合制方法,在基于规则智能体的平均归一化得分上至少高出 16%。此外,我们讨论了多种实际用例,以突出 RallyNet 的适用性。
引用
@article{arxiv.2403.12406,
title = {Offline Imitation of Badminton Player Behavior via Experiential Contexts and Brownian Motion},
author = {Kuang-Da Wang and Wei-Yao Wang and Ping-Chun Hsieh and Wen-Chih Peng},
journal= {arXiv preprint arXiv:2403.12406},
year = {2024}
}
备注
Accepted by the European Conference on Machine Learning and Principles and Practice of Knowledge Discovery in Databases (ECML PKDD 2024)