中文

超越惊奇:通过惊奇新颖性改进探索

机器学习 2024-02-01 v2

摘要

我们提出一种用于强化学习内在奖励的新计算模型,以解决现有惊奇驱动探索的局限性。该奖励是惊奇的新颖性而非惊奇范数。我们将惊奇新颖性估计为记忆网络的检索误差,其中记忆存储并重建惊奇。我们的惊奇记忆(SM)增强了基于惊奇的内在动机子能力,在保持智能体对兴奋探索兴趣的同时,减少对不可预测或噪声观测的不必要吸引。实验表明,SM 与多种惊奇预测器结合可展现高效探索行为,并显著提升在稀疏奖励环境(包括 Noisy-TV、导航及高难度 Atari 游戏)中的最终性能。

关键词

引用

@article{arxiv.2308.04836,
  title  = {Beyond Surprise: Improving Exploration Through Surprise Novelty},
  author = {Hung Le and Kien Do and Dung Nguyen and Svetha Venkatesh},
  journal= {arXiv preprint arXiv:2308.04836},
  year   = {2024}
}

备注

17 pages including Appendix