中文

用于强化学习的无监督基函数自适应

人工智能 2017-03-06 v1 机器学习 机器学习

摘要

在使用强化学习(RL)算法评估策略时,鉴于状态空间庞大,引入某种形式的价值函数(VF)近似架构是很常见的。然而,这种架构的确切形式会对 VF 估计的准确性产生重大影响,并且确定合适的近似架构通常是一项高度复杂的任务。因此,人们对允许 RL 算法自适应生成近似架构的潜力抱有极大兴趣。我们研究了一种自适应近似架构的方法,该方法利用关于智能体访问某些状态的频率反馈,来指导对状态空间中哪些区域进行更详细的近似。这种方法是“无监督”的,即它不直接参考奖励或 VF 估计。我们引入了一种基于此思想的算法,该算法在线自适应调整状态聚合近似架构。对 VF 估计进行评分的一种常用方法是,按每个状态-动作发生的概率对其平方 Bellman 误差进行加权。采用这种评分方法,并假设有 SS 个状态,我们在理论上证明了——只要满足 (1) 状态聚合架构中的单元数 XX 达到 Slog2SlnS\sqrt{S}\log_2{S}\ln{S} 量级或更多,(2) 策略和转移函数接近确定性,以及 (3) 转移函数的先验分布为均匀分布——我们的算法与合适的 RL 算法结合使用时,在 SS 变大时可以保证得分任意接近于零。尽管只有 O(Xlog2S)O(X \log_2S) 的空间复杂度和可忽略的时间复杂度,它仍能做到这一点。这些结果利用了马尔可夫链平稳分布的某些性质。

关键词

引用

@article{arxiv.1703.01026,
  title  = {Unsupervised Basis Function Adaptation for Reinforcement Learning},
  author = {Edward W. Barker and Charl J. Ras},
  journal= {arXiv preprint arXiv:1703.01026},
  year   = {2017}
}

备注

Extended abstract submitted (3 March 2017) for 3rd Multidisciplinary Conference on Reinforcement Learning and Decision Making (RLDM) 2017