VIREL:一种用于强化学习的变分推断框架
机器学习
2020-07-17 v9 机器学习
摘要
将概率模型应用于强化学习(RL)使得变分推断等强大的优化工具可用于 RL。然而,现有的推断框架及其算法对学习最优策略提出了重大挑战,例如伪似然方法中缺乏模式捕获行为,以及基于最大熵 RL 的方法难以学习确定性策略。我们提出 VIREL,一种新颖的、有理论依据的概率推断框架,用于 RL,它利用参数化动作值函数来总结底层 MDP 的未来动态。这使得 VIREL 具有模式寻求形式的 KL 散度、从推断中自然学习确定性最优策略的能力,以及以分离的迭代步骤优化值函数和策略的能力。通过将变分期望最大化应用于 VIREL,我们由此表明 actor-critic 算法可归约为期望最大化,其中策略改进等价于 E-step,策略评估等价于 M-step。我们随后从 VIREL 推导出一系列 actor-critic 方法,包括一种自适应探索方案。最后,我们证明了该系列中的 actor-critic 算法在多个领域中优于基于软值函数的最先进方法。
引用
@article{arxiv.1811.01132,
title = {VIREL: A Variational Inference Framework for Reinforcement Learning},
author = {Matthew Fellows and Anuj Mahajan and Tim G. J. Rudner and Shimon Whiteson},
journal= {arXiv preprint arXiv:1811.01132},
year = {2020}
}