通过结合混合专家模型与蒙特卡洞树搜索提升棋类游戏表现
机器学习
2025-06-18 v3
摘要
在棋类游戏中,策略在不同阶段(开局、中局、残局)都会发生剧变——每一阶段都需要不同的推理和决策方式。然而,许多现代棋类引擎依赖单一神经网络在整个游戏中统一作战,往往错失专业化的机会。本文引入了M2CTS框架,结合混合专家模型(Mixture of Experts)与蒙特卡洞树搜索(MCTS),以根据游戏阶段动态调整策略。我们探讨了三种不同的神经网络训练方法:分离学习(Separated Learning)、阶段性学习(Staged Learning)和加权学习(Weighted Learning)。通过通过为每个阶段训练的专用神经网络进行路由决策,M2CTS在计算效率和棋力方面均取得提升。在棋类游戏实验中,M2CTS相对于标准单模型基线提升了最高可达+122 Elo分,同时在Pommerman等多智能体领域显示出良好的泛化能力。这些结果表明,模块化、阶段感知的系统更符合游戏的结构性特征,使我们更接近于人类在将问题划分为多个小单元方面的行为方式。
引用
@article{arxiv.2401.16852,
title = {Checkmating One, by Using Many: Combining Mixture of Experts with MCTS to Improve in Chess},
author = {Felix Helfenstein and Johannes Czech and Jannis Blüml and Max Eisel and Kristian Kersting},
journal= {arXiv preprint arXiv:2401.16852},
year = {2025}
}
备注
31 pages, 33 figures, 15 tables. Code available under https://github.com/QueensGambit/CrazyAra