中文

AlphaViT:一种适用于多种游戏和可变棋盘大小的灵活游戏 AI

机器学习 2025-12-01 v3 人工智能

摘要

我们提出了三种将视觉 Transformer(ViT)集成到 AlphaZero 框架中的游戏代理:AlphaViT、AlphaViD(带有 Transformer 解码器的 AlphaViT)和 AlphaVDA(带有可学习动作嵌入的 AlphaViD)。这些代理可以使用具有共享权重的单个神经网络来玩多种不同大小的棋盘游戏,从而克服了 AlphaZero 固定棋盘大小的限制。AlphaViT 仅使用 Transformer 编码器,而 AlphaViD 和 AlphaVDA 则同时包含 Transformer 编码器和解码器。在 AlphaViD 中,解码器处理来自编码器的输出,而 AlphaVDA 使用可学习的嵌入作为解码器的输入。AlphaViD 和 AlphaVDA 中额外的解码器提供了适应各种动作空间和棋盘大小的灵活性。实验结果表明,所提出的代理在单个游戏或多个游戏上同时训练时,始终优于传统算法,如 Minimax 和蒙特卡洛树搜索。尽管依赖于具有共享权重的单个深度神经网络(DNN),它们的性能仍接近 AlphaZero。特别是,AlphaViT 在所有评估的游戏上表现强劲。此外,使用在小棋盘游戏上预训练的权重对 DNN 进行微调,可以加速收敛并提高性能,尤其是在五子棋中。有趣的是,在多个游戏上同时训练的性能与单一游戏训练的性能相当,甚至更优。这些结果表明,基于 Transformer 的架构在开发更灵活、更稳健、擅长多种游戏和动态环境的游戏 AI 代理方面具有潜力。

关键词

引用

@article{arxiv.2408.13871,
  title  = {AlphaViT: A flexible game-playing AI for multiple games and variable board sizes},
  author = {Kazuhisa Fujita},
  journal= {arXiv preprint arXiv:2408.13871},
  year   = {2025}
}