用于改进实时策略游戏对战学习的奖励塑形
机器学习
2023-11-29 v1 人工智能
摘要
我们研究了在实时策略夺旗游戏背景下,奖励塑形对提升强化学习性能的影响。该游戏的特征在于与罕见事件(如夺取或捕获旗帜,或标记对方玩家)相关的稀疏奖励。我们表明,应用于不同游戏事件的恰当设计的奖励塑形函数,能够显著提升玩家性能及玩家学习算法的训练时间。我们在一个模拟环境中验证了我们的奖励塑形函数,该环境用于两名玩家之间的海军夺旗游戏。我们的实验结果表明,奖励塑形可作为一种有效手段,用于理解游戏对战中朝向获胜的不同子任务的重要性、将能量效率等次要目标函数编码进玩家的游戏行为,以及改进可泛化策略的学习,使其能对不同技能水平的对手表现良好。
引用
@article{arxiv.2311.16339,
title = {Reward Shaping for Improved Learning in Real-time Strategy Game Play},
author = {John Kliem and Prithviraj Dasgupta},
journal= {arXiv preprint arXiv:2311.16339},
year = {2023}
}
备注
15 pages 11 figures and 5 tables