用于黑白棋(翻转棋)对弈的文字游戏
机器学习
2022-07-19 v1
摘要
诸如 OpenAI 的 Generative Pre-Trained Transformers(GPT-2/3)之类的语言模型,捕捉了在多种领域(如语言翻译器)中生成文本所需的长期相关性,近来也应用于棋类对弈(国际象棋、围棋和西洋跳棋)。本研究将较大的(GPT-3)与较小的(GPT-2)语言模型均应用于探索黑白棋(或称翻转棋,Reverses)的复杂策略。鉴于该游戏局势迅速逆转的规则,语言模型不仅基于先前的走子表征下一步的候选预测器,还避免了博弈中的稀疏奖励。该语言模型自动捕捉或模仿冠军级策略。微调后的 GPT-2 模型生成的黑白棋对局完成度在 13%–71% 之间,而较大的 GPT-3 模型达到整局的 41%。与先前国际象棋和围棋的工作类似,这些语言模型提供了一种生成合理对局档案的新途径,尤其可用于在远超人力可探索的更大样本中比较开局走法。这些模型的一个主要贡献是将此前的玩家档案记录(1977–2022 年 45 年间 120,000 局人类对局)放大了两倍,从而为研究界提供了更多样且原创的策略,以供其他强化学习技术进行采样。
引用
@article{arxiv.2207.08766,
title = {Word Play for Playing Othello (Reverses)},
author = {Samantha E. Miller Noever and David Noever},
journal= {arXiv preprint arXiv:2207.08766},
year = {2022}
}