中文

作为多目标强化学习的内在探索

机器学习 2020-04-07 v1 机器学习

摘要

当奖励非常稀疏时,内在动机使强化学习(RL)智能体能够进行探索,而传统的探索启发式方法(如 Boltzmann 或 ε-greedy)通常会失效。然而,内在探索一般以临时方式处理,探索未被视作学习过程的核心目标;这种薄弱的 formulation 导致次优的探索性能。为克服该问题,我们提出一种基于多目标 RL 的框架,其中探索与利用均作为独立目标进行优化。该 formulation 在策略层面带来了探索与利用之间的平衡,相较于传统方法具有优势。这还允许在学习过程中以零额外代价控制探索。此类策略实现了对智能体探索的一定程度控制,这是此前经典或内在奖励所无法达到的。我们通过提出一种基于该框架的方法(EMU-Q)展示了向连续状态-动作空间的扩展性,该方法将探索引导至价值函数不确定性更高的区域。实验表明,在连续控制基准和机械臂上,EMU-Q 优于经典探索技术及其他内在 RL 方法。

关键词

引用

@article{arxiv.2004.02380,
  title  = {Intrinsic Exploration as Multi-Objective RL},
  author = {Philippe Morere and Fabio Ramos},
  journal= {arXiv preprint arXiv:2004.02380},
  year   = {2020}
}