Quinoa:一种在动作上推断归一化 Q 函数的算法
机器学习
2019-11-06 v1 神经与进化计算
摘要
我们提出了一种在相对熵正则化强化学习设定中学习近似动作值软 Q 函数的算法,由此可以以闭式恢复出最优改进策略。我们利用归一化流(normalising flows)的最新进展来参数化策略以及学习到的价值函数;并展示了如何将这种组合用于隐式表示连续动作空间中任意策略的 Q 值。随后对 Q 值使用简单的时间差分学习,便得到策略与价值学习的统一目标。我们展示了该方法如何大幅简化标准的 Actor-Critic 离策略算法,消除了策略优化步骤的需要。我们在一组成熟的强化学习基准上进行了实验,表明我们的方法允许在连续动作空间中存在复杂、多峰的策略分布,同时保持从策略采样的过程既快速又精确。
引用
@article{arxiv.1911.01831,
title = {Quinoa: a Q-function You Infer Normalized Over Actions},
author = {Jonas Degrave and Abbas Abdolmaleki and Jost Tobias Springenberg and Nicolas Heess and Martin Riedmiller},
journal= {arXiv preprint arXiv:1911.01831},
year = {2019}
}
备注
Deep RL Workshop/NeurIPS