潜状态边缘化作为一种低成本改进探索的方法
机器学习
2023-02-13 v2 人工智能
机器学习
摘要
最大熵(MaxEnt)强化学习(RL)框架——常因其探索和鲁棒性能力而被推崇——通常从概率视角进行动机说明,但由于其固有复杂性,深度概率模型的使用在实践中并未获得太多关注。在本工作中,我们提出在 MaxEnt 框架内采用潜变量策略,我们证明该策略可证明地逼近任意策略分布,并且此外,在使用具有潜信念状态的世界模型时会自然涌现。我们讨论了潜变量策略为何难以训练、朴素方法如何失败,随后引入一系列以低成本边缘化潜状态为核心的改进,使我们能以极小的额外代价充分利用潜状态。我们在 actor-critic 框架下实例化我们的方法,对 actor 和 critic 均进行边缘化。所得算法称为随机边缘化 Actor-Critic (SMAC),简单而有效。我们在连续控制任务上实验验证了我们的方法,表明有效的边缘化可带来更好的探索和更鲁棒的训练。我们的实现已开源:https://github.com/zdhNarsil/Stochastic-Marginal-Actor-Critic。
引用
@article{arxiv.2210.00999,
title = {Latent State Marginalization as a Low-cost Approach for Improving Exploration},
author = {Dinghuai Zhang and Aaron Courville and Yoshua Bengio and Qinqing Zheng and Amy Zhang and Ricky T. Q. Chen},
journal= {arXiv preprint arXiv:2210.00999},
year = {2023}
}
备注
Accepted by ICLR 2023