中文

强化学习中的拉普拉斯算子:基于高效近似的表示学习

机器学习 2018-10-11 v1 机器学习

摘要

图拉普拉斯算子的最小特征向量众所周知地提供了加权图几何的简洁表示。在强化学习(RL)中,加权图可解释为行为策略作用于环境所诱导的状态转移过程,近似拉普拉斯算子的特征向量为状态表示学习提供了一种有前景的方法。然而,现有的执行该近似的方法在一般 RL 设定中并不适用,主要有两个原因:首先,它们计算代价高,常需要对大矩阵进行操作。其次,除简单的、表格化的、有限状态设定外,这些方法缺乏充分的依据。本文提出一种在无模型 RL 背景下近似拉普拉斯算子特征向量的完全通用且可扩展的方法。我们系统地评估了我们的方法,并经验性地表明它可推广到表格化有限状态设定之外。即使在表格化有限状态设定中,其近似特征向量的能力也优于以往的提案。最后,我们展示了在目标达成 RL 任务中使用由我们的方法学习的拉普拉斯表示潜在益处,提供了证据表明我们的技术可用于显著提升 RL 智能体的性能。

关键词

引用

@article{arxiv.1810.04586,
  title  = {The Laplacian in RL: Learning Representations with Efficient Approximations},
  author = {Yifan Wu and George Tucker and Ofir Nachum},
  journal= {arXiv preprint arXiv:1810.04586},
  year   = {2018}
}