中文

将经验回放与随机网络蒸馏探索相结合

机器学习 2019-12-03 v1 人工智能 机器学习

摘要

我们的工作是对论文《Exploration by Random Network Distillation》的一个简单扩展。更具体地说,我们展示了如何高效地将内在奖励(Intrinsic Rewards)与经验回放(Experience Replay)相结合,以实现比 PPO/RND 更高效且更鲁棒的探索,从而在智能体性能和样本效率方面取得更好的结果。我们通过使用一种名为优先过采样经验回放(Prioritized Oversampled Experience Replay, POER)的新技术来实现这一点,该技术建立在对“有益于回放的重要经验”的定义之上。最后,我们在著名的 Atari 游戏 Montezuma's Revenge 以及其他一些困难探索的 Atari 游戏上评估了我们的技术。

关键词

引用

@article{arxiv.1905.07579,
  title  = {Combining Experience Replay with Exploration by Random Network Distillation},
  author = {Francesco Sovrano},
  journal= {arXiv preprint arXiv:1905.07579},
  year   = {2019}
}

备注

8 pages, 6 figures, accepted as full-paper at IEEE Conference on Games (CoG) 2019