基于信息受限基元竞争集的强化学习
机器学习
2019-06-26 v1 人工智能
机器学习
摘要
在多样且复杂环境中运行的强化学习智能体可受益于其行为的结构化分解。通常,这在分层强化学习的背景下被解决,其目标是将策略分解为底层基元或选项,以及在高层次情况下触发适当行为的高层元策略。然而,元策略仍必须在所有状态下做出适当决策。在本工作中,我们提出一种分解为基元的策略设计,类似于分层强化学习,但没有高层元策略。相反,每个基元可自行决定是否在当前状态下行动。我们采用信息论机制实现这种去中心化决策:每个基元选择其做出决策所需的关于当前状态的信息量,而请求当前状态信息最多的基元在环境中行动。基元被正则化以尽可能少地使用信息,这导致了自然的竞争与专门化。我们通过实验证明,该策略架构在泛化能力方面优于扁平策略和分层策略。
引用
@article{arxiv.1906.10667,
title = {Reinforcement Learning with Competitive Ensembles of Information-Constrained Primitives},
author = {Anirudh Goyal and Shagun Sodhani and Jonathan Binas and Xue Bin Peng and Sergey Levine and Yoshua Bengio},
journal= {arXiv preprint arXiv:1906.10667},
year = {2019}
}
备注
Preprint, Under Review