揭开MuZero规划的面纱:解读所学习的模型
人工智能
2025-07-18 v2 机器学习
摘要
MuZero通过使用动力学网络预测环境动力学进行规划,无需依赖模拟器,在各种游戏中实现了超越人类的表现。然而,动力学网络所学习的潜在状态使其规划过程不透明。本文旨在通过解读所学习的潜在状态来揭开MuZero模型的面纱。我们在MuZero训练中引入了观测重建和状态一致性,并对两个棋盘游戏——9x9围棋和五子棋——以及三个Atari游戏——Breakout、Ms. Pacman和Pong——的潜在状态进行了深入分析。我们的发现表明,尽管动力学网络在更长模拟中变得不太准确,但MuZero仍通过规划来纠正错误而有效运行。我们的实验还表明,动力学网络在棋盘游戏中比在Atari游戏中学习到更好的潜在状态。这些见解有助于更好地理解MuZero,并为未来研究改进MuZero算法的性能、鲁棒性和可解释性提供了方向。代码和数据可在 https://rlg.iis.sinica.edu.tw/papers/demystifying-muzero-planning 获取。
引用
@article{arxiv.2411.04580,
title = {Demystifying MuZero Planning: Interpreting the Learned Model},
author = {Hung Guei and Yan-Ru Ju and Wei-Yu Chen and Ti-Rong Wu},
journal= {arXiv preprint arXiv:2411.04580},
year = {2025}
}
备注
Accepted by IEEE Transactions on Artificial Intelligence