中文

DEIR:基于判别模型的分集内在奖励实现高效且鲁棒的探索

机器学习 2023-05-19 v2 人工智能 信息论 math.IT

摘要

探索是强化学习(RL)的一个基本方面,其有效性是RL算法性能的决定因素,尤其是在面临稀疏外在奖励时。最近的研究表明,利用从观测新颖性估计出的内在奖励来鼓励探索是有效的。然而,观测的新颖性与一次探索之间存在差距,因为环境中的随机性和智能体的行为都可能影响观测。为了准确评估探索行为,我们提出了DEIR这一新方法,在理论上推导出一个包含条件互信息项的内在奖励,该项原则上随智能体探索所贡献的新颖性而缩放,随后使用判别前向模型实现该奖励。在MiniGrid上的标准与高级探索任务的广泛实验表明,DEIR比基线更快学到更好的策略。我们在ProcGen上的评估展示了我们内在奖励的泛化能力和普遍适用性。我们的源代码可在 https://github.com/swan-utokyo/deir 获取。

关键词

引用

@article{arxiv.2304.10770,
  title  = {DEIR: Efficient and Robust Exploration through Discriminative-Model-Based Episodic Intrinsic Rewards},
  author = {Shanchuan Wan and Yujin Tang and Yingtao Tian and Tomoyuki Kaneko},
  journal= {arXiv preprint arXiv:2304.10770},
  year   = {2023}
}

备注

Accepted as a conference paper to the 32nd International Joint Conference on Artificial Intelligence (IJCAI-23)