将带有标记的量子强化学习探索策略扩展至四子棋
机器学习
2025-05-09 v1 量子物理
摘要
基于标记的动作选择是一种强化学习(RL)探索策略,它通过使用标记来改善状态空间的探索,这些标记能够识别在每个状态下最有希望采取的动作。该探索策略的量子对应版本通过利用对带标记动作进行采样的二次加速,进一步改进了这一策略。这种方法已成功应用于跳棋游戏。在本工作中,我们描述了该方法在四子棋(Connect Four)环境中的应用,以研究其在不同环境下的性能,这有助于更好地推广该技术。我们还跟踪了以往工作中未考虑的一项指标:获得带标记动作的平均迭代次数。由于在四子棋中后手是一个显著的劣势,我们还打算探索这种更复杂的场景将如何影响我们方法的性能。实验涉及训练和测试经典与量子RL智能体,使其在对抗随机化 Negamax 对手时分别作为先手和后手进行对弈。结果表明,两种带标记的探索策略均明显优于简单的 epsilon-greedy 策略。此外,量子智能体确实在更少的迭代次数内完成了带标记动作的采样。尽管更一致地获得了带标记动作,但该方法的经典与量子版本之间的胜率是相同的,这可能是由于所选训练场景的简单性所致。
引用
@article{arxiv.2505.04371,
title = {Extending a Quantum Reinforcement Learning Exploration Policy with Flags to Connect Four},
author = {Filipe Santos and João Paulo Fernandes and Luís Macedo},
journal= {arXiv preprint arXiv:2505.04371},
year = {2025}
}
备注
8 pages, 3 figures, to be submitted to a journal