将经验回放与随机网络蒸馏探索相结合
机器学习
2019-12-03 v1 人工智能
机器学习
摘要
我们的工作是对论文《Exploration by Random Network Distillation》的一个简单扩展。更具体地说,我们展示了如何高效地将内在奖励(Intrinsic Rewards)与经验回放(Experience Replay)相结合,以实现比 PPO/RND 更高效且更鲁棒的探索,从而在智能体性能和样本效率方面取得更好的结果。我们通过使用一种名为优先过采样经验回放(Prioritized Oversampled Experience Replay, POER)的新技术来实现这一点,该技术建立在对“有益于回放的重要经验”的定义之上。最后,我们在著名的 Atari 游戏 Montezuma's Revenge 以及其他一些困难探索的 Atari 游戏上评估了我们的技术。
引用
@article{arxiv.1905.07579,
title = {Combining Experience Replay with Exploration by Random Network Distillation},
author = {Francesco Sovrano},
journal= {arXiv preprint arXiv:1905.07579},
year = {2019}
}
备注
8 pages, 6 figures, accepted as full-paper at IEEE Conference on Games (CoG) 2019