中文

VIME:变分信息最大化探索

机器学习 2017-01-30 v4 人工智能 机器人学 机器学习

摘要

可扩展且有效的探索仍然是强化学习(RL)中的一个关键挑战。虽然在离散状态和动作空间设定下有最优保证的方法,但这些方法无法应用于高维深度 RL 场景。因此,大多数当代 RL 依赖于简单的启发式方法,例如 epsilon-greedy 探索或向控制添加高斯噪声。本文介绍了变分信息最大化探索(VIME),一种基于最大化智能体对环境动态信念的信息增益的探索策略。我们提出了一种实用实现,在贝叶斯神经网络中使用变分推断,有效处理连续状态和动作空间。VIME 修改了 MDP 奖励函数,并且可以应用于几种不同的底层 RL 算法。我们证明了在多种连续控制任务和算法上,包括具有非常稀疏奖励的任务,VIME 相比启发式探索方法实现了显著更好的性能。

关键词

引用

@article{arxiv.1605.09674,
  title  = {VIME: Variational Information Maximizing Exploration},
  author = {Rein Houthooft and Xi Chen and Yan Duan and John Schulman and Filip De Turck and Pieter Abbeel},
  journal= {arXiv preprint arXiv:1605.09674},
  year   = {2017}
}

备注

Published in Advances in Neural Information Processing Systems 29 (NIPS), pages 1109-1117