中文

利用回声状态网络逼近控制问题的值函数

动力系统 2021-06-28 v2 人工智能

摘要

回声状态网络(ESN)是一种单层递归神经网络,其内权随机选取且输出层可训练。我们在温和条件下证明,一个足够大的回声状态网络可以逼近一大类随机与确定性控制问题的值函数。此类控制问题通常是非马尔可夫的。我们描述了 ESN 如何作为非马尔可夫框架下新颖且计算高效的强化学习算法的基础。我们用两个例子演示该理论。第一个例子中,我们使用 ESN 解决一个确定性的、部分可观测的控制问题,即我们称之为“Bee World”的简单博弈。第二个例子中,我们考虑一个受数学金融中做市问题启发的随机控制问题。在这两种情况下,我们都能将算法动力学与解析解进行比较,表明即使仅经过一次强化策略迭代,算法也能得到良好的策略。

关键词

引用

@article{arxiv.2102.06258,
  title  = {Using Echo State Networks to Approximate Value Functions for Control},
  author = {Allen G. Hart and Kevin R. Olding and A. M. G. Cox and Olga Isupova and J. H. P. Dawes},
  journal= {arXiv preprint arXiv:2102.06258},
  year   = {2021}
}