基于在线微调的博弈求解
人工智能
2023-11-14 v1 计算机科学与博弈论
机器学习
摘要
博弈求解是一项与精通博弈相似却更为困难的任务。求解一个博弈通常意味着找到博弈论值(最优博弈下的结果),以及可选地一套用以达成该结果的完整策略。AlphaZero 算法已展现出超人类水平的对弈能力,其强大的策略与价值预测亦作为启发式方法服务于博弈求解。然而,为求解博弈并获得完整策略,必须为失败方所有可能的走法找到获胜应对。这包括失败方极其糟糕的行棋路线,而 AlphaZero 自对弈过程不会遇到此类情况。基于 AlphaZero 的启发式方法在评估这些分布于整个搜索中的分布外位置时可能高度不准确。为解决该问题,本文研究在搜索过程中应用在线微调,并提出两种为博弈求解学习定制启发式的方法。我们的实验表明,使用在线微调可求解一系列具挑战性的 7x7 Killall-Go 问题,仅耗费无在线微调基线 23.54% 的计算时间。结果表明节省随问题规模而放大。我们的方法可进一步扩展至任意用于问题求解的树搜索算法。我们的代码发布于 https://rlg.iis.sinica.edu.tw/papers/neurips2023-online-fine-tuning-solver。
引用
@article{arxiv.2311.07178,
title = {Game Solving with Online Fine-Tuning},
author = {Ti-Rong Wu and Hung Guei and Ting Han Wei and Chung-Chin Shih and Jui-Te Chin and I-Chen Wu},
journal= {arXiv preprint arXiv:2311.07178},
year = {2023}
}
备注
Accepted by the 37th Conference on Neural Information Processing Systems (NeurIPS 2023)