在无知识条件下学习博弈双人完美信息游戏
人工智能
2025-05-08 v5
摘要
本文提出了若干通过强化学习来学习博弈状态评估函数的技术。第一种是树自举(树学习)的推广:它适用于基于非线性函数的无知识强化学习情境。借助该技术,强化学习过程中不会丢失任何信息。第二种是对无界深度 minimax 的改进,将最佳动作序列延伸至终止状态。该改进搜索旨在用于学习过程中。第三种是用强化启发式替代经典的博弈收益(+1 / -1)。我们研究了特定的强化启发式,例如:快速获胜与缓慢失败;计分;机动性或存在性。第四种是一种新的动作选择分布。实验结果表明这些技术提升了博弈水平。最后,我们将这些不同技术应用于设计 Hex(尺寸 11 和 13)的程序玩家,通过无知识的自博弈强化学习超越了 Mohex 3HNN 的水平。
引用
@article{arxiv.2008.01188,
title = {Learning to Play Two-Player Perfect-Information Games without Knowledge},
author = {Quentin Cohen-Solal},
journal= {arXiv preprint arXiv:2008.01188},
year = {2025}
}