基于深度拉普拉斯算子的时序扩展探索选项
机器学习
2023-06-12 v2 人工智能
摘要
选择能够生成丰富经验流以促进更好学习的探索性动作,是强化学习(RL)中的基本挑战。解决该问题的一种方法是在较长时间内依据特定策略选择动作,即所谓的选项(options)。近期推导此类探索性选项的工作建立在图拉普拉斯算子的特征函数之上。重要的是,迄今为止这些方法大多局限于表格域,其中(1)图拉普拉斯矩阵要么给定要么可完全估计,(2)对该矩阵进行特征分解在计算上可行,且(3)价值函数可被精确学习。此外,这些方法还需要独立的选项发现阶段。这些假设从根本上说不可扩展。本文中我们解决这些局限,并展示如何利用直接近似拉普拉斯算子特征函数的最新成果来真正扩展基于选项的探索。为此,我们引入了一种完全在线的深度 RL 算法来发现基于拉普拉斯的选项,并在多种基于像素的任务上评估了我们的方法。我们与几种最先进的探索方法进行比较,表明我们的方法有效、通用,并且在非平稳设置中尤其有前景。
引用
@article{arxiv.2301.11181,
title = {Deep Laplacian-based Options for Temporally-Extended Exploration},
author = {Martin Klissarov and Marlos C. Machado},
journal= {arXiv preprint arXiv:2301.11181},
year = {2023}
}