等变 MuZero
机器学习
2023-02-10 v1 人工智能
机器学习
摘要
深度强化学习在象棋、围棋、星际争霸等封闭、定义良好的领域反复取得成功。下一前沿是真实世界场景,其中设置繁多且多样。为此,智能体需要学习支配环境的基本规则,以稳健地泛化到与其训练条件不同的情形。基于模型的强化学习算法,如高度成功的 MuZero,旨在通过学习的世界模型实现这一点。然而,相较于无模型替代方案,利用世界模型并未一致地展现出更强的泛化能力。在本工作中,我们提出通过在 MuZero 的世界模型架构中显式引入环境的对称性,来提升其数据效率与泛化能力。我们证明,只要 MuZero 使用的神经网络对作用于环境的特定对称群等变,则 MuZero 整个动作选择算法也将对该群等变。我们在程序生成的 MiniPacman 与来自 ProcGen 套件的 Chaser 上评估等变 MuZero:在一组迷宫上训练,然后在未见过的旋转版本上测试,展示了等变带来的益处。此外,我们验证了即使仅等变 MuZero 的部分组件遵守严格等变性,性能提升依然成立,这凸显了我们构建的鲁棒性。
引用
@article{arxiv.2302.04798,
title = {Equivariant MuZero},
author = {Andreea Deac and Théophane Weber and George Papamakarios},
journal= {arXiv preprint arXiv:2302.04798},
year = {2023}
}
备注
9 pages, 3 figures