超越惊奇:通过惊奇新颖性改进探索
机器学习
2024-02-01 v2
摘要
我们提出一种用于强化学习内在奖励的新计算模型,以解决现有惊奇驱动探索的局限性。该奖励是惊奇的新颖性而非惊奇范数。我们将惊奇新颖性估计为记忆网络的检索误差,其中记忆存储并重建惊奇。我们的惊奇记忆(SM)增强了基于惊奇的内在动机子能力,在保持智能体对兴奋探索兴趣的同时,减少对不可预测或噪声观测的不必要吸引。实验表明,SM 与多种惊奇预测器结合可展现高效探索行为,并显著提升在稀疏奖励环境(包括 Noisy-TV、导航及高难度 Atari 游戏)中的最终性能。
引用
@article{arxiv.2308.04836,
title = {Beyond Surprise: Improving Exploration Through Surprise Novelty},
author = {Hung Le and Kien Do and Dung Nguyen and Svetha Venkatesh},
journal= {arXiv preprint arXiv:2308.04836},
year = {2024}
}
备注
17 pages including Appendix