中文

奖励情景访问差异以促进强化学习中的探索

机器学习 2022-11-11 v4 人工智能

摘要

在具有高位观测和稀疏奖励的复杂环境中,探索对深度强化学习至关重要。为解决此问题,近期方法提出利用内在奖励来改善探索,例如基于新颖性的探索和基于预测的探索。然而,许多内在奖励模块需要复杂的结构和表示学习,导致计算复杂度过高且性能不稳定。本文中,我们提出奖励情景访问差异(REVD),一种计算高效且可量化的探索方法。更具体地,REVD 通过评估情景之间基于 Rényi 散度的访问差异来提供内在奖励。为实现高效的散度估计,使用了带有随机初始化状态编码器的 k 近邻估计器。最后,REVD 在 Atari 游戏和 PyBullet 机器人环境上进行了测试。大量实验表明,REVD 能显著提升强化学习算法的样本效率并优于基准方法。

关键词

引用

@article{arxiv.2209.08842,
  title  = {Rewarding Episodic Visitation Discrepancy for Exploration in Reinforcement Learning},
  author = {Mingqi Yuan and Bo Li and Xin Jin and Wenjun Zeng},
  journal= {arXiv preprint arXiv:2209.08842},
  year   = {2022}
}

备注

16 pages, 9 figures; Deep RL Workshop NeurIPS 2022