中文

基于交叉熵引导策略的连续动作 Q 学习

人工智能 2019-07-03 v3

摘要

离策略强化学习(RL)是许多问题域(如机器人)的重要方法类,其中数据收集成本高昂,因而策略上方法不可行。将 Q 学习应用于连续值动作域的标准方法包括迭代采样 Q 函数以寻找良好动作(如通过爬山),或在学习 Q 函数的同时学习策略网络(如 DDPG)。两类方法均在稳定性、速度与精度间权衡。我们提出一种称为交叉熵引导策略(CGP)的新方法,其受上述两类技术启发,旨在将迭代采样策略的稳定性与性能同策略网络的低计算成本相结合。我们的方法使用交叉熵方法(CEM)的迭代采样训练 Q 函数,同时训练策略网络以模仿 CEM 的采样行为。我们证明,相较 SOTA 策略网络方法,我们的方法训练更稳定,且保持同等的推理时间计算成本,并在标准基准上取得有竞争力的总奖励。

关键词

引用

@article{arxiv.1903.10605,
  title  = {Q-Learning for Continuous Actions with Cross-Entropy Guided Policies},
  author = {Riley Simmons-Edler and Ben Eisner and Eric Mitchell and Sebastian Seung and Daniel Lee},
  journal= {arXiv preprint arXiv:1903.10605},
  year   = {2019}
}