中文

EMI:基于互信息的探索

机器学习 2019-06-14 v6 人工智能 机器学习

摘要

强化学习算法在奖励信号非常稀疏时表现不佳。在这些情况下,朴素的随机探索方法本质上依赖于随机游走以偶然碰到有奖励的状态。近期工作利用内在动机,通过生成模型、预测前向模型或新颖性的判别建模来引导探索。我们提出 EMI,这是一种探索方法,它构建状态和动作的嵌入表示,不依赖于对完整观测的生成式解码,而是提取可用于基于表示空间中的前向预测来引导探索的预测信号。我们的实验在具有连续控制的挑战性运动任务以及具有离散动作的 Atari 基于图像的探索任务上展示了有竞争力的结果。源代码可在 https://github.com/snu-mllab/EMI 获取。

关键词

引用

@article{arxiv.1810.01176,
  title  = {EMI: Exploration with Mutual Information},
  author = {Hyoungseok Kim and Jaekyeom Kim and Yeonwoo Jeong and Sergey Levine and Hyun Oh Song},
  journal= {arXiv preprint arXiv:1810.01176},
  year   = {2019}
}

备注

Accepted and to appear at ICML 2019