中文

潜状态边缘化作为一种低成本改进探索的方法

机器学习 2023-02-13 v2 人工智能 机器学习

摘要

最大熵(MaxEnt)强化学习(RL)框架——常因其探索和鲁棒性能力而被推崇——通常从概率视角进行动机说明,但由于其固有复杂性,深度概率模型的使用在实践中并未获得太多关注。在本工作中,我们提出在 MaxEnt 框架内采用潜变量策略,我们证明该策略可证明地逼近任意策略分布,并且此外,在使用具有潜信念状态的世界模型时会自然涌现。我们讨论了潜变量策略为何难以训练、朴素方法如何失败,随后引入一系列以低成本边缘化潜状态为核心的改进,使我们能以极小的额外代价充分利用潜状态。我们在 actor-critic 框架下实例化我们的方法,对 actor 和 critic 均进行边缘化。所得算法称为随机边缘化 Actor-Critic (SMAC),简单而有效。我们在连续控制任务上实验验证了我们的方法,表明有效的边缘化可带来更好的探索和更鲁棒的训练。我们的实现已开源:https://github.com/zdhNarsil/Stochastic-Marginal-Actor-Critic。

关键词

引用

@article{arxiv.2210.00999,
  title  = {Latent State Marginalization as a Low-cost Approach for Improving Exploration},
  author = {Dinghuai Zhang and Aaron Courville and Yoshua Bengio and Qinqing Zheng and Amy Zhang and Ricky T. Q. Chen},
  journal= {arXiv preprint arXiv:2210.00999},
  year   = {2023}
}

备注

Accepted by ICLR 2023