OLIVAW:无需人类知识亦无需巨额算力的奥赛罗精通之道
机器学习
2022-03-07 v4 人工智能
摘要
我们介绍了 OLIVAW,一个采用著名 AlphaGo 系列程序设计原则的 AI 奥赛罗棋手。OLIVAW 背后的主要动机是以其杰出前辈极小部分的成本在非平凡棋盘游戏中达到卓越水平。在本文中,我们展示了如何仅使用商用硬件与免费云服务,将 AlphaGo Zero 的范式成功应用于流行的奥赛罗游戏。尽管比国际象棋或围棋简单,奥赛罗仍保有可观的搜索空间与局面评估难度。为达成此结果,OLIVAW 实现了受近期工作启发的若干改进以加速标准 AlphaGo Zero 学习过程。主要修改在于训练阶段每局收集的位置翻倍,即同时纳入未被落子但被智能体充分探索过的位置。我们以三种方式测试了 OLIVAW 的实力:将其与最强开源奥赛罗引擎 Edax 对弈,在 OthelloQuest 网络平台上匿名对局,以及最终与顶尖人类棋手进行两场面对面比赛:一位全国冠军与一位前世界冠军。
引用
@article{arxiv.2103.17228,
title = {OLIVAW: Mastering Othello without Human Knowledge, nor a Fortune},
author = {Antonio Norelli and Alessandro Panconesi},
journal= {arXiv preprint arXiv:2103.17228},
year = {2022}
}
备注
Accepted for publication in IEEE Transactions on Games. Presented at AAAI-21 Reinforcement Learning in Games Workshop, 8 pages