全卷积策略-价值网络在游戏及游戏变体间的迁移
机器学习
2023-12-11 v1
摘要
在本文中,我们在类 AlphaZero 的自对弈训练设置中使用全卷积架构,以促进棋盘游戏变体之间以及不同游戏之间的迁移。我们探索如何基于 Ludii 通用游戏系统状态与动作表示中通道的共享语义来迁移这些架构的已训练参数。我们利用 Ludii 庞大的游戏与游戏变体库进行广泛的迁移学习评估,包括零样本迁移实验以及带有额外微调时间的实验。
引用
@article{arxiv.2102.12375,
title = {Transfer of Fully Convolutional Policy-Value Networks Between Games and Game Variants},
author = {Dennis J. N. J. Soemers and Vegard Mella and Eric Piette and Matthew Stephenson and Cameron Browne and Olivier Teytaud},
journal= {arXiv preprint arXiv:2102.12375},
year = {2023}
}