马尔萨斯式强化学习
神经与进化计算
2019-03-05 v2 多智能体系统
种群与进化
摘要
在此我们探索一种用于多智能体强化学习的新算法框架,称为马尔萨斯式强化学习(Malthusian reinforcement learning),其将自我博弈扩展为包含与适应度挂钩的种群规模动态,以驱动持续创新。在马尔萨斯式 RL 中,子种群平均回报的增加会驱动其规模随后的扩大,正如托马斯·马尔萨斯在 1798 年所论证的前工业收入水平与人口增长之间的关系。马尔萨斯式强化学习利用由种群规模增减所产生的竞争压力,驱动智能体探索其原本无法触及的状态与策略空间区域。此外,在存在专业化与劳动分工潜在收益的环境中,我们表明马尔萨斯式强化学习比基于自我博弈的算法更能利用此类协同效应。
引用
@article{arxiv.1812.07019,
title = {Malthusian Reinforcement Learning},
author = {Joel Z. Leibo and Julien Perolat and Edward Hughes and Steven Wheelwright and Adam H. Marblestone and Edgar Duéñez-Guzmán and Peter Sunehag and Iain Dunning and Thore Graepel},
journal= {arXiv preprint arXiv:1812.07019},
year = {2019}
}
备注
9 pages, 2 tables, 4 figures