中文

用于探索的参数空间噪声

机器学习 2018-02-01 v2 人工智能 神经与进化计算 机器人学 机器学习

摘要

深度强化学习(RL)方法通常通过动作空间中的噪声注入来进行探索行为。一种替代方案是将噪声直接添加到智能体的参数中,这能带来更一致的探索以及更丰富的行为集合。诸如进化策略的方法使用参数扰动,但在此过程中丢弃所有时间结构且需要显著更多的样本。将参数噪声与传统RL方法结合可兼得两者之长。我们通过DQN、DDPG和TRPO在高维离散动作环境以及连续控制任务上的实验对比,证明离策略与在策略方法均受益于该方法。我们的结果表明,带有参数噪声的RL比传统的带动作空间噪声的RL以及单独的进化策略学习得更高效。

关键词

引用

@article{arxiv.1706.01905,
  title  = {Parameter Space Noise for Exploration},
  author = {Matthias Plappert and Rein Houthooft and Prafulla Dhariwal and Szymon Sidor and Richard Y. Chen and Xi Chen and Tamim Asfour and Pieter Abbeel and Marcin Andrychowicz},
  journal= {arXiv preprint arXiv:1706.01905},
  year   = {2018}
}

备注

Updated to camera-ready ICLR submission