多智能体强化学习模型的缩放定律
机器学习
2023-02-14 v2
摘要
近期观测到的神经幂律缩放关系对深度学习领域产生了重大影响。因此,大量注意力被投入到缩放定律的描述上,尽管主要集中在监督学习,且仅在较小程度上涉及强化学习框架。在本文中,我们对基石级强化学习算法AlphaZero的性能缩放进行了广泛研究。基于Elo评分、博弈强度与幂律缩放之间的关系,我们在Connect Four和Pentago游戏上训练AlphaZero智能体并分析其性能。我们发现,当不受可用算力瓶颈限制时,玩家强度随神经网络参数数量呈幂律缩放;而当训练最优规模智能体时,随算力呈幂缩放。我们观察到两款游戏的缩放指数几乎相同。结合两个观测到的缩放定律,我们获得了类似于语言模型中观测到的、关联最优规模与算力的幂律。我们发现预测的最优神经网络规模缩放符合两款游戏的数据。该缩放定律意味着,鉴于各自的算力预算,先前发表的最先进博弈模型明显小于其最优规模。我们还展示了大型AlphaZero模型具有更高的样本效率,在相同训练数据量下表现优于较小模型。
引用
@article{arxiv.2210.00849,
title = {Scaling Laws for a Multi-Agent Reinforcement Learning Model},
author = {Oren Neumann and Claudius Gros},
journal= {arXiv preprint arXiv:2210.00849},
year = {2023}
}