MuZero 学习了什么模型?
机器学习
2024-10-15 v4 人工智能
摘要
基于模型的强化学习 (MBRL) 因其有望提高样本效率而近年来备受关注。此外,使用深度学习模型使得从数据中学习紧凑且可泛化的模型成为可能。在本研究中,我们研究 MuZero,这是一种最先进的深度基于模型的强化学习算法,其通过学习价值等价模型而区别于现有算法。尽管 MuZero 在 MBRL 领域取得了成功并产生了影响,但现有文献尚未深入探讨为何 MuZero 在实践中表现如此出色。具体而言,对于 MuZero 学习到的价值等价模型及其在基于模型的信用分配和策略改进中的有效性,目前缺乏深入研究,而这对于在 MBRL 中实现样本效率至关重要。为了填补这一空白,我们通过实证分析探索了两个基本问题:1) MuZero 在多大程度上实现了其价值等价模型的学习目标,以及 2) 这些模型对策略改进有多大用处?我们的发现表明,MuZero 的模型在评估未见策略时难以泛化,这限制了其进一步改进策略的能力。然而,MuZero 在 MCTS 中结合策略先验缓解了这一问题,因为这将搜索偏向于模型更准确的动作。
引用
@article{arxiv.2306.00840,
title = {What model does MuZero learn?},
author = {Jinke He and Thomas M. Moerland and Joery A. de Vries and Frans A. Oliehoek},
journal= {arXiv preprint arXiv:2306.00840},
year = {2024}
}
备注
ECAI 2024