奖励情景访问差异以促进强化学习中的探索
机器学习
2022-11-11 v4 人工智能
摘要
在具有高位观测和稀疏奖励的复杂环境中,探索对深度强化学习至关重要。为解决此问题,近期方法提出利用内在奖励来改善探索,例如基于新颖性的探索和基于预测的探索。然而,许多内在奖励模块需要复杂的结构和表示学习,导致计算复杂度过高且性能不稳定。本文中,我们提出奖励情景访问差异(REVD),一种计算高效且可量化的探索方法。更具体地,REVD 通过评估情景之间基于 Rényi 散度的访问差异来提供内在奖励。为实现高效的散度估计,使用了带有随机初始化状态编码器的 k 近邻估计器。最后,REVD 在 Atari 游戏和 PyBullet 机器人环境上进行了测试。大量实验表明,REVD 能显著提升强化学习算法的样本效率并优于基准方法。
引用
@article{arxiv.2209.08842,
title = {Rewarding Episodic Visitation Discrepancy for Exploration in Reinforcement Learning},
author = {Mingqi Yuan and Bo Li and Xin Jin and Wenjun Zeng},
journal= {arXiv preprint arXiv:2209.08842},
year = {2022}
}
备注
16 pages, 9 figures; Deep RL Workshop NeurIPS 2022