基于课程学习的双层深度Q网络策略优化
机器学习
2025-12-30 v1 人工智能
摘要
网球策略优化是涉及层次化评分、随机结果、长期信用分配、身体疲劳以及对对手技能适应的挑战性序列决策问题。本文提出一种强化学习框架,将定制网球仿真环境与采用课程学习训练的Dueling Double Deep Q-Network(DDQN)集成。该环境在点、局、赛的层面完整建模网球评分,沿 rally 级别的战术决策覆盖十个离散动作类别,考虑对称疲劳动力学,并引入连续对手技能参数。双层架构将动作价值估计分解为状态价值和优势组件,而双Q学习减少了高估偏差,提高了该长期随机域的训练稳定性。课程学习从0.40逐渐提升至0.50的对手难度,使智能体能够在不采用固定对手的情况下实现稳健的技能学习。在广泛的评估中,训练后的智能体对手平衡时获胜率在98%至100%之间,对更具挑战性的对手仍表现出色。服务效率为63.0%至67.5%,返球效率为52.8%至57.1%。消融研究表明,双层架构和课程学习对稳定收敛至关重要,而标准DQN基线未能学习有效策略。尽管性能优异,战术分析揭示了明显的防守倾向,所学策略优先考虑错误避免和延长比赛而非积极构建分点。这些结果凸显了以赢率为导向的优化在简化运动仿真中的局限性,强调了奖励设计对现实网球强化学习的重要性。
引用
@article{arxiv.2512.22186,
title = {Learning Tennis Strategy Through Curriculum-Based Dueling Double Deep Q-Networks},
author = {Vishnu Mohan},
journal= {arXiv preprint arXiv:2512.22186},
year = {2025}
}
备注
27 pages, 10 figures