中文

用于学习高斯策略的平滑动作值函数

机器学习 2018-07-26 v3 人工智能

摘要

状态-动作值函数(即 Q 值)在强化学习(RL)中无处不在,催生了诸如 SARSA 与 Q-learning 等流行算法。我们提出一种由期望 Q 值的高斯平滑版本所定义的动作值新概念。我们证明此类平滑 Q 值仍满足贝尔曼方程,使其可从环境采样所得经验中学习。此外,参数化高斯策略的均值与协方差相对于期望奖励的梯度可由平滑 Q 值函数的梯度与 Hessian 恢复。基于这些关系,我们开发了直接从所学平滑 Q 值近似器训练高斯策略的新算法。该方法还可通过在目标中增设对与前一策略 KL 散度惩罚项而适用于近端优化。我们发现,训练期间同时学习均值与协方差的能力在标准连续控制基准上带来了显著改进的结果。

关键词

引用

@article{arxiv.1803.02348,
  title  = {Smoothed Action Value Functions for Learning Gaussian Policies},
  author = {Ofir Nachum and Mohammad Norouzi and George Tucker and Dale Schuurmans},
  journal= {arXiv preprint arXiv:1803.02348},
  year   = {2018}
}

备注

ICML 2018