积木井字棋:探索 AlphaZero 对新颖测试环境的泛化能力
机器学习
2022-07-15 v2 人工智能
摘要
传统的强化学习(RL)环境通常在训练和测试阶段是相同的。因此,当前的 RL 方法在很大程度上无法泛化到在概念上相似但不同于其所训练环境的测试环境,我们称之为新颖测试环境。为了推动 RL 研究朝向能够泛化到新颖测试环境的算法,我们引入了积木井字棋(BTTT)测试平台,其中测试环境中的积木位置不同于训练环境。通过在 BTTT 环境上的循环赛,我们表明传统的 RL 状态搜索方法如蒙特卡洛树搜索(MCTS)和 Minimax 比 AlphaZero 更能泛化到新颖测试环境。这令人惊讶,因为 AlphaZero 已被证明在围棋、国际象棋和将棋等环境中达到超人性能,这可能让人认为它在新颖测试环境中表现良好。我们的结果表明,BTTT 虽然简单,但足以丰富地探索 AlphaZero 的泛化能力。我们发现,仅增加 MCTS 前瞻迭代次数不足以让 AlphaZero 泛化到某些新颖测试环境。相反,增加训练环境的多样性有助于逐步改善跨所有可能起始积木配置的泛化能力。
引用
@article{arxiv.2207.05991,
title = {Brick Tic-Tac-Toe: Exploring the Generalizability of AlphaZero to Novel Test Environments},
author = {John Tan Chong Min and Mehul Motani},
journal= {arXiv preprint arXiv:2207.05991},
year = {2022}
}
备注
AlphaZero, Generalization